人工知能学会にインスパイアされたので文章の重複排除を試してみた|むっそ
文字列と意味の類似性を使い分ける文章重複検出の実装体験。
著者が合成テスト文でNearDupとSemDeDupを試し、表現が違う文章の扱いと本番の閾値設定を考察する。
学習・文字列の比較:単語をMinHashへ変換し、LSHで比較候補を絞る試作を紹介する。/確認 2026-09-14/https://note.com/mussso/n/nee8fb58d5d19
学習・意味の比較:埋め込みで類似性を扱い、意味の重複まで除くかと閾値を用途に合わせて決める必要を説明する。/確認 2026-09-14/https://note.com/mussso/n/nee8fb58d5d19
対象:AIの開発・導入・活用を検討する担当者。形式:企業・著者による公開記事。言語:日本語(公開本文で確認)。利用条件:公開記事(本文をログインなしで確認)
確認事項(編集部):著者が論文通りの厳密な実装ではないと明記した試作。LLMで指定した類似率は正解ラベルとして検証されていない。
出典:むっそ「人工知能学会にインスパイアされたので文章の重複排除を試してみた」/公開・更新情報:2024-06-10/確認日:2026-09-14/https://note.com/mussso/n/nee8fb58d5d19
株式会社世良(Sera, Inc.)/ お問い合わせ: info@sera-inc.co.jp