Adrians Skapars (エイドリアンズ・スカパース) と Edoardo Manino (エドアルド・マニーノ) は2026年8月31日(現地時間)、「BLOOM-WILT」と呼ばれる新しい自動監査パイプラインを発表した。これは、言語モデル (LLM) の展開時に表面化する稀な振る舞いを、トレーニングコストやモデルの次トークン分布へのアクセスなしに効率的に検出することを目的としている。従来の自動監査ツールが抱えるサンプル効率の課題に対処する。

展開された言語モデルは、評価時にシミュレートされるよりもはるかに多くの相互作用を経験するため、テストでは検知されない行動を示すことが課題となっていた。自動化された監査ツールはスケーラビリティと柔軟性を持つ一方で、最適化の圧力が不足しているためにサンプル効率が低いという問題があった。

BLOOM-WILTはこの課題に対処するため、稀な行動の自然な複数ターンインスタンスを効率的に引き出すフル監査パイプラインとして機能する。入力側では、WILTの監査モデルが過去の相互作用から学習し、対話戦略をラウンドごとに修正する。出力側では、ターゲットモデルのデコーディングを適応的に再重み付けし、特定の喚起プロンプトに基づいて、プロンプトなしで同等に確率的と判断される他の生成よりも行動関連の生成を優先的にサンプリングする仕組みを導入している。

研究者らは、4つのターゲットモデルと8つの行動にわたってWILTを評価した。その結果、32の設定のうち30でベースライン監査ツールを上回り、これまでのモデルの安全性ランキングを覆した。特にQwen3.5-4Bからself-harm encouragement (自傷行為の奨励)を喚起する際、平均行動出現率を51%から100%に向上させた。これは、同等の計算リソースで同じパイプラインに移植された他の喚起方法を上回り、かつ出力確率をベースライン以下に押し下げることなく達成された。


参考: arXiv cs.AI — 2026年9月1日 02:10 (JST)

原文ハイライト

"WILT raises average behaviour presence from 51% to 100% when eliciting self-harm encouragement"

この記事をシェア
X はてブ LinkedIn