Zing Teamは2026年7月26日(現地時間)、大規模言語モデル(LLM)に人間環境での長期サービスに必要な「社会性知能」を付与するための統合フレームワーク「Zhijing」を発表した。このフレームワークは社会性知能の測定、内面化、展開時の基礎付けを目的としている。研究報告では、20の代表的なLLMを評価した結果、最良モデルの全体精度が72.08%に留まり、社会性知能には大きな改善の余地があることが示された。

Zhijingフレームワークの測定部分には、心理学に基づいたベンチマーク「SoMBench」が導入された。SoMBenchは3つの主要次元、17の二次次元、71のタスクパラダイムから構成される。これには284の共通シナリオと3,481の専門家検証済みインスタンスが含まれており、質問形式、物語の視点、文脈長が制御されている。

SoMBenchによる評価の結果、17の二次次元のいずれも90%の目標帯域に到達しておらず、既存のLLMにおける社会性知能の性能向上にはかなりの余地があると見られる。

社会性知能の内面化のためには、診断駆動型トレーニングレシピ「Zing」が開発された。Zingは教師ありファインチューニング、オンポリシー蒸留、ルーブリックベースの強化学習を組み合わせる。5つの社会認知ベンチマークにおいて、Zingはベースモデルを一貫して上回り、Zing-27B-Stage2は最高の平均スコアを達成し、Zing-32B-Stage2はDeepSeek-V4-Proと競争力のある性能を示した。

また、展開時における社会性知能の基礎付けを目的として、ハーネス制御推論アーキテクチャ「Actio」が構築された。Actioは、手続き的ガイダンスのためのPRISM、ランタイム精神状態表現のためのStarling、再利用可能な経験のためのSAGE、外部の社会・規範的知識のためのgated RAGという4種類のサポートを推論にルーティングする。5つのベースモデルと3つのベンチマークを用いた実験では、Actioのフルハーネスが15のモデル-ベンチマークペアのうち14を改善し、8つのペアで最高または同等の結果を示し、ランタイムサポートの有効性を実証した。

これらの結果は、社会性知能を持つLLMの実現には、評価、パラメトリックな内面化、および展開時の基礎付けにおける協調的な進歩が必要であることを示唆している。


参考: arXiv cs.CL (アーカイブ) — 2026年7月27日 01:25 (JST)

原文ハイライト

"the ability to infer mental states, track social relations, reason over norms"

この記事をシェア
X はてブ LinkedIn