イッツェル・トレロ=コヨテカトル (Itzel Tlelo-Coyotecatl) 氏とウーゴ・ハイア・エスカランテ (Hugo Jair Escalante) 氏は9月25日(現地時間)、メキシコ・スペイン語の動画におけるヘイトスピーチ検出に特化した新たなデータセット「メックスハット (MexHat)」を発表した。オンライン環境の安全性確保とコンテンツ監視の強化を目指し、メキシコの特定の文化的・言語的ニュアンスを深く捉えるよう設計された本データセットは、多言語におけるヘイトスピーチ対策研究に貢献すると期待されている。

メックスハット (MexHat) データセットは、メキシコ・スペイン語のオンライン動画から抽出された約1,000の動画クリップで構成され、それぞれに専門的な注釈が付与されている。この注釈付けプロセスは二つの主要なタスクに分かれる。一つ目のタスクでは、コンテンツを「否定的内容なし」「攻撃的コンテンツ」「ヘイトスピーチコンテンツ」の三分類で評価する。二つ目のタスクは、ヘイトスピーチをさらに詳細な三つのサブカテゴリに分類するもので、対象コンテンツの文脈依存的かつ文化関連的な性質をより深くモデルが学習できるように設計されている。

近年、オンライン上のヘイトスピーチは社会問題として深刻化しており、その自動検出技術の確立が喫緊の課題となっている。特に、非英語圏の言語におけるヘイトスピーチ検出リソースの不足は、多言語環境におけるオンライン安全確保の大きな障壁である。メックスハットは、この課題に対応するため、メキシコ・スペイン語という特定の文化的・言語的背景に焦点を当て、その独特な表現形式やニュアンスを捉えることに重点を置いている。これにより、一般的なヘイトスピーチ検出モデルでは見過ごされがちな、地域特有の含意や皮肉表現などを識別できるよう支援する。

データセットの構築にあたり、研究チームはメキシコの多様なオンラインコミュニティからコンテンツを収集し、厳格なガイドラインに基づいて注釈付けを行った。このプロセスを通じて、ヘイトスピーチの多面的な性質と、それが異なる文脈でどのように現れるかを浮き彫りにした。初期の統計分析とベースラインモデルを用いた実験結果は、メキシコ・スペイン語におけるヘイトスピーチ検出タスクに内在する複雑性と課題を明確に示している。既存の多言語モデルや英語ベースのモデルが直面する限界を克服し、言語固有の特性を考慮した検出アプローチの必要性が強調されている。

本研究は、計算機言語学および人工知能の分野における重要な一歩と位置付けられる。メックスハットの公開は、メキシコ・スペイン語話者コミュニティにおけるオンラインの安全性向上に直接貢献するだけでなく、他の非英語言語におけるヘイトスピーチ検出研究の進展を促す可能性を秘めている。将来的には、このデータセットが多言語対応のヘイトスピーチ検出システムの開発や、より包括的なコンテンツモデレーション戦略の策定に役立つことが期待される。本研究成果はシアープ 2026 (CIARP 2026)に投稿されたものとして公開されている。


参考: arXiv cs.CL — 2026年9月26日 02:23 (JST)

この記事をシェア
X はてブ LinkedIn