レゴ設計AI評価の新ベンチマーク「ブリックベンチ」発表、既存エージェントの課題示唆
Peter Kulits氏らは10月8日(現地時間)、エージェントによるテキスト条件付きLEGOセット設計の評価を目的とした新たなベンチマーク「ブリックベンチ (BrickBench)」を発表した。このベンチマークは、テキストプロンプトに基づいて意味的・設計基準を満たし、かつ物理的に構築可能なアセンブリを設計するエージェントの能力を客観的に評価する。評価の結果、既存の主要なAIエージェントが一定の要件を満たすものの、人間の設計者には及ばない現状が明らかになったと指摘されている。