LLMエージェントの自己改善能力を評価、新ベンチマーク「AI4AI-Bench」公開
arXiv cs.AI は8月20日(現地時間)、大規模言語モデル(LLM)エージェントがAIシステムを生成する学習アルゴリズムを設計する能力、すなわち「再帰的自己改善(RSI)」の可能性を評価する新たなベンチマーク「AI4AI-Bench」を発表した。このベンチマークは、既存の評価手法がデータ収集やハイパーパラメータ調整に偏っていた点を補完し、モデルがどのように学習するか自体を変更する能力の測定を目指す。
Tag
1 件の関連記事