リサーチ・論文

スロバキア語向けテキスト埋め込み「SkMTEB」発表、低リソース言語のモデル開発を促進

arXiv cs.CLは2026年6月11日(現地時間)、Marek Šuppa氏らが執筆した論文を公開し、その中で低リソース言語であるスロバキア語を対象とした初の包括的なテキスト埋め込みベンチマーク「SkMTEB」を発表した。このベンチマークは、31のデータセットと7種類のタスクタイプで構成されており、既存の多言語ベンチマークに比べスロバキア語の網羅範囲が約4倍深く、精緻な評価を可能にする。論文では、31の埋め込みモデルを評価した結果、大規模な命令チューニング済み多言語モデルが最も高い性能を示し、既存のスロバキア語特化NLUモデルは埋め込みタスクへの転移性能が低いことが判明したと報告している。

ベンダー・製品

IBM、多言語埋め込みモデルR2を発表 32Kコンテキスト対応

IBMは2026年5月4日(現地時間)、オープンソースライセンスの多言語埋め込みモデル「Granite Embedding Multilingual R2」を発表した。このリリースには、ModernBERTを基盤とする2つのモデルが含まれる。97Mパラメータのコンパクトモデルは、MTEB Multilingual Retrievalにおいてオープンな100Mパラメータ未満の全埋め込みモデル中で最高スコアを記録した。また、311Mパラメータのフルサイズモデルも公開され、両モデルともに200以上の言語をサポートし、52言語で強化された検索品質、32Kトークンのコンテキスト長、Apache 2.0ライセンスでの提供が特徴である。