TraceBench、LLMエージェントの時系列根本原因分析評価フレームワークを発表
TraceBench(トレースベンチ)は8月27日(現地時間)、時系列データにおける根本原因分析を行う大規模言語モデル(LLM)エージェントの評価に特化した、シミュレーションベースのフレームワークを発表した。同フレームワークは、これまで制御された条件下での体系的な評価が不足していたLLMエージェントの性能を測定し、現実世界の複雑なシステムから得られる時系列観測値の異常検知と根本原因分析への適用拡大を目的としている。