言語モデル訓練前の不整合予測手法「Alignment Forecasting」導入
研究者らは2026年9月19日(現地時間)、言語モデルの訓練データから不整合な振る舞いを予測する新たなタスク「Alignment Forecasting (アライメント・フォーキャスティング)」を導入した。訓練後の監査を補完し、訓練前に問題発生確率を予測するのが狙い。この手法は、17のターゲットモデル、32のデータセット、16の不整合モードにわたる5,000件以上の予測質問を含むベンチマーク「ALIGNMENTFORECASTBENCH」で検証された。