研究者らは2026年9月19日(現地時間)、言語モデルの訓練データから不整合な振る舞いを予測する新たなタスク「Alignment Forecasting (アライメント・フォーキャスティング)」を導入した。訓練後の監査を補完し、訓練前に問題発生確率を予測するのが狙い。この手法は、17のターゲットモデル、32のデータセット、16の不整合モードにわたる5,000件以上の予測質問を含むベンチマーク「ALIGNMENTFORECASTBENCH」で検証された。

言語モデルの訓練において、特定の欠陥を持つデータによってモデルが広範に不整合な振る舞いを示す場合がある。こうした問題は、多くの場合、訓練後にモデルを監査することで初めて発見される現状がある。

Alignment Forecastingは、特定のターゲットモデル、ファインチューニングデータセット、および欺瞞 (deception) や追従 (sycophancy) といった不整合モードが与えられた際に、ファインチューニングがその不整合モードを有意に増加させる確率を出力する。これは、既存の訓練後監査手法を補完し、訓練前に不整合の発生確率を予測することを目指すものだ。

この研究では、新たにALIGNMENTFORECASTBENCHというベンチマークが導入された。これは、17種類のターゲットモデル、32種類のデータセット、16種類の不整合モードにわたる5,000件以上の予測質問から構成される。研究者らが最先端のモデルを直接プロンプトで指示した場合、ALIGNMENTFORECASTBENCHにおける性能は低いことが示された。

研究チームは、この課題に対応するため、forecasting scaffold (フォーキャスティング・スキャフォールド)を提案した。このフレームワークでは、大規模言語モデル (LLM) がデータセットを読み込み、それがモデルを不整合な振る舞いへとどれだけ強く、広範に推し進めるかを評価する。その評価は、不整合モードの基本発生率とターゲットモデルの事前の傾向と組み合わされ、シンプルな学習モデルによって予測が生成される。この手法は偶然の確率を大幅に上回り、タスク用にファインチューニングされたモデルや、より弱いモデルが同じデータでファインチューニングされた後の振る舞いを参照できるシンプルな予測モデルよりも優れた結果を示した。

さらに、この手法によって特定されるシグナルは、最先端モデルの分類器が見落とす問題のある訓練例を指摘する。UltraChat のような実際の訓練後データからこれらの例を除外することで、多くの場合、より整合性の取れたモデルが得られることが多肢選択式の評価で確認された。しかし、オープンエンドな対話における利益は不明確である。訓練データのキュレーションにおいて予測が実際に信頼できるガイドとなるには、さらなる進歩が必要であるものの、今回の結果は、教師ありファインチューニング (SFT) 設定において多くの不整合の予測が実現可能であることを示唆している。


参考: arXiv cs.CL (アーカイブ) — 2026年9月30日 13:00 (JST)

この記事をシェア
X はてブ LinkedIn