オープンソースベンチマーク、AIのロボット設計力を検証
ハーバード大学工学応用科学部とジョージア工科大学は共同で、人工知能コードエージェントの物理ロボット設計能力を評価するオープンソースベンチマークRLE-Benchを開発・公開した。ハーバード大学のリ・ナ教授とジョージア理工大のダイ・ボー准教授が主導し、大学院生や助教が参画する本プロジェクトは、AIがデジタル領域のコード生成を超え、実世界の物理制約を考慮した自律的なロボット工学タスクを遂行できるかを測定する初の体系的枠組みである。 RLE-Benchは48のタスクと、インタラクティブ制御、ポリシー開発、知覚推定、機械設計の4カテゴリで構成される。既存のベンチマークが制御政策の学習評価に偏る傾向にあるのに対し、本システムはエージェントのコード能力に加え、センシング、力学、安定性、ハードウェア仕様、およびソフトウェアと物理環境の相互作用に関する推論能力を総合的に試験する。タスクはシミュレーション環境で実行されるが、質量、トルク、幾何学などの物理法則に厳密に拘束される。設計課題の一例では、計算上は妥当な移動ベースの提案が、荷重追加時に転倒するなどの物理的不安定さを露呈するケースが確認され、純粋なアルゴリズム最適化では捉えきれない物理推論の重要性が実証された。 本ベンチマークはオープンソースとして公開され、研究コミュニティは共通の基準で新規AIシステムを比較・評価可能となった。リ教授は初期リリースを基盤と位置づけ、ハードウェア設計、シミュレーション、システム統合、デバッグ、安全性、展開などの実務課題を反映した次期バージョンの実現に向け、専門家からのタスク投稿を促進する計画である。この取り組みは、AIのコード自動化が実物理環境への展開段階で直面する能力ギャップを可視化し、自律型ロボット開発の次の段階へ向かう標準的な評価インフラを提供するものと期待されている。