Calibrated User Embeddings、AIエージェントの多目的評価で効果
arXiv cs.CLは2026年10月1日(現地時間)、論文「CUEing User Simulators: Calibrated User Embeddings for Multi-Turn Benchmarking」を発表し、AIエージェントの多目的インタラクション評価における既存ユーザーシミュレータの課題を指摘しました。Anjali Kantharuban氏らの研究チームは、既存シミュレータが実際のユーザーとの相互作用で観察される成功率や失敗パターンとの整合性に欠ける「outcome calibration」不足があることを分析。この課題に対し、大規模言語モデル(LLM)をトレーニングなしでユーザーシミュレータとして制御する新たなフレームワーク「Calibrated User Embeddings(CUE)」を導入しました。