arXiv cs.AIは2026年7月31日(現地時間)、論文「AgentHPOBench: A Benchmark For Evaluating LLM Agents as Sequential Hyperparameter Optimizers」を公開した。この論文は、大規模言語モデル (LLM) エージェントがシーケンシャルなハイパーパラメータ最適化器として実験を実行する能力を評価するための新たなベンチマーク AgentHPOBench (エージェントエイチピーオーベンチ) を導入している。既存のベンチマークがLLMエージェントの実験的証拠の解釈能力を直接評価していない課題に対応するため開発された。

AgentHPOBenchは、7つの研究カテゴリにわたる30の実行可能な機械学習タスクで構成される。各タスクは検証済みのベースライン実行から開始され、その後、エージェントが複数のシーケンシャルな介入を実施する。各ステップにおいて、エージェントは蓄積された構成、メトリクス、およびログを観察し、次の有効な構成を提案する仕組みだ。

研究では、12の広く使用されているエージェントと従来のハイパーパラメータ最適化 (HPO) ベースラインが統一されたプロトコルで評価された。結果として、現在のエージェントはドメイン全体で測定可能な実験最適化能力を示すものの、持続的な反復改善、複雑なログ診断、および報告された参照性能へ一貫して進歩する点に明確な限界があることが示された。

この論文は、Tianyu Huai (ティアンユ・フアイ) をはじめとする計8名の著者によって執筆された。


参考: arXiv cs.AI (アーカイブ) — 2026年8月1日 01:58 (JST)

原文ハイライト

"current agents exhibit measurable experimental optimization ability across domains"

この記事をシェア
X はてブ LinkedIn