Peter Kulits氏らは10月8日(現地時間)、エージェントによるテキスト条件付きLEGOセット設計の評価を目的とした新たなベンチマーク「ブリックベンチ (BrickBench)」を発表した。このベンチマークは、テキストプロンプトに基づいて意味的・設計基準を満たし、かつ物理的に構築可能なアセンブリを設計するエージェントの能力を客観的に評価する。評価の結果、既存の主要なAIエージェントが一定の要件を満たすものの、人間の設計者には及ばない現状が明らかになったと指摘されている。
arXiv cs.AIで公開された研究論文「ブリックベンチ」は、テキストプロンプトに基づいてレゴブロックの設計を行うエージェントが近年進化を遂げている一方で、その評価がこれまで体系化されていなかったと指摘する。研究チームは、エージェントが離散的なパーツライブラリから適切な部品を選択し、局所的および全体的な制約について総合的に推論することで、物理的に構築可能な設計を生み出す能力を客観的に評価するベンチマークの必要性を強調している。
「ブリックベンチ」による評価は、規模とパーツの可用性が異なる3つの設定で実施され、エージェントの性能を多角的に分析する。具体的には、評価は以下の3つの主要な側面でスコアリングされる。
- 妥当性 (validity): 設計されたモデルが物理的に構築可能であるか、構造的に安定しているか、ブロック間の接続が正しいかといった、物理的実現可能性に関する基準。
- 整合性 (alignment): 設計が、与えられたテキストプロンプトの意図や指定されたテーマ、コンセプトにどの程度合致しているかという、意味的および機能的な整合性に関する基準。
- 設計 (design): 設計の創造性、複雑性、美的側面、パーツ利用の効率性など、設計品質そのものに関する基準。
これらの側面は、エージェントが単にブロックを配置するだけでなく、意味を理解し、物理的法則を考慮した上で、高品質な成果物を生み出す能力を測るために重要とされる。研究チームはまた、エージェントが設計したモデルを仮想空間で「構築、検査、検証」するためのシミュレーション環境であるブリックエージェント (BrickAgent)も提供している。この環境は、エージェントが自律的に設計をテストし、物理的エラーや不整合を特定・修正するプロセスを支援することで、設計サイクル全体の効率を高める役割を果たす。
分析の結果、既存の主要なエージェントは、物理的および意味的な検証要件を高い精度で満たすものの、人間が設計したモデルと比較すると、創造性やパーツの効率的な使用、および直感的な美的感覚の面で依然として課題が残ることが判明した。例えば、複雑な構造やユニークな形状の設計、あるいは少ないパーツで同様の効果を実現する能力において、人間の設計者には及ばない点が浮き彫りになった。
「ブリックベンチ」のベンチマークと「ブリックエージェント」環境は、今後のエージェントベースのレゴ設計技術の発展を促進するため、公開されている。これにより、研究コミュニティは統一された基準でモデルを比較し、より洗練された設計AIの開発を進めることが期待される。
参考: arXiv cs.AI — 2026年10月9日 02:58 (JST)