开源基准测试评估AI智能体构建实体机器人能力
近日,哈佛大学工程与应用科学学院与佐治亚理工学院联合团队发布开源基准测试平台RLE-Bench,旨在系统评估AI编程代理在真实机器人工程中的综合能力。该基准测试包含48项核心任务,覆盖交互控制、策略开发、感知估计与机械结构设计四大维度,为AI机器人学习工程师提供标准化考核体系。与传统侧重控制策略的测试不同,RLE-Bench强调软件代码与物理世界的深度耦合。测试在仿真环境中运行,但严格遵循物理定律约束。研究发现,多数AI代理生成的代码在算法层面看似合理,却常因忽略质量分布、扭矩限制或系统稳定性等物理因素,导致实际机器人出现倾覆或功能失效。研究负责人Na Li教授指出,该基准不仅检验代码生成能力,更考察AI对传感器数据、系统动力学及软硬件交互的逻辑推理水平。目前,RLE-Bench已全面开源,供全球科研人员统一验证新模型。团队表示,首版仅为起点,未来将吸纳社区贡献,逐步扩展至新型硬件设计、系统集成与工业部署等复杂工程场景,推动具身智能向自主机器人工程师角色演进。
此资讯由 AI 智能聚合生成,旨在高效传递行业动态,不代表任何观点或建议。