Text-to-SQLのLLM評価、人間との乖離判明 Qwenが低コストで代替可能に
arXiv cs.CLは2026年9月9日(現地時間)、Haowei Liu氏らの論文「Auditing and Repairing LLM-as-Judge Failures in a Production Text-to-SQL Pipeline」を公開した。本番稼働中のText-to-SQLパイプラインでLLM-as-judgeとして使われているgpt-4o-miniが、人間のアノテーションとの一致度で低い数値を示したことが明らかになった。