arXiv cs.CLは2026年9月9日(現地時間)、Haowei Liu氏らの論文「Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline」を公開した。本番稼働中のText-to-SQLパイプラインでLLM-as-judgeとして使われているgpt-4o-miniが、人間のアノテーションとの一致度で低い数値を示したことが明らかになった。

論文によると、Text-to-SQLパイプラインで評価モデルとして運用されているgpt-4o-miniは、人間の評価者とのコーエンのカッパ値が、乖離が強調されたデータセットで0.04、ランダム抽出したデータセットで0.42にとどまった。人間が正しいと判断したケースのうち77.1%をgpt-4o-miniが過剰にフラグ付けしており、研究チームはこの主因を「GRADE-HALLUCINATION」と名付けた単一のメカニズムに帰した。

研究者らは代替モデルとして、自己ホスト型のQwen3.6-27Bを評価した。その結果、コーエンのカッパ値は0.72に達し、Claude Opus 4.7の0.71とほぼ同水準となった。Qwen3.6-27Bはコールあたりのコストが約300分の1で済むため、展開コストの面で優位性があるとされる。

一方、複数の弱い評価モデルを組み合わせても人間との合意度は向上しなかった。弱い評価モデルと強い評価モデルを組み合わせた場合は、むしろ合意度が低下する結果となった。これに対し、3つの強い評価モデルによる「全会一致ルーティング」を採用したケースでは、コーエンのカッパ値が0.79まで上昇し、自動カバレッジは89.7%に達した。

研究チームはこの監査手法をドメイン外のデータセットにも適用した。専門家が作成したBIRD-financialのゴールドSQLを対象に検証したところ、25.5%が研究チームのアノテーションプロトコル上、候補となるゴールドSQLの問題として検出された。

関連するコードと事前登録情報はGitHub上で公開されている。


参考: arXiv cs.CL (アーカイブ) — 2026年9月28日 13:00 (JST)

原文ハイライト

"Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline"

この記事をシェア
X はてブ LinkedIn