全球 AI 日报GLOBAL AI DAILY

头版 / 2026-10-06

智源 FlagEval-Robo 用仿真与真机双轨评测具身模型

智源研究院在 8 月发布 FlagEval-Robo,结合仿真任务与真机操作检验具身模型;其局限在模型样本、任务差异和有限的数据污染核查。

所属期次 2026-10-06 · 署名:无敌帅

智源研究院称其于 8 月 21 日发布 FlagEval-Robo,设置 FlagEval-Robo-Sim 仿真榜单与 FlagEval-Robo-Real 真机榜单,希望对照模型在可复现环境和真实操作中的表现。发布说明报告了 12 个开源模型的评测结果,仿真侧覆盖桌面、精细操作、安全及长程任务;真机侧以原子动作、原子指令和组合任务拆解失败原因。这是本期的背景观察,并非 10 月 6 日的新榜单。

其中的 ATOM-Bench 项目页公开了真机任务与指标:单臂和双臂平台合计 30 个原子任务、24 个留出的组合任务,并区分任务成功率、过程成功率和组合失败占比。在该项目展示的五个代表性策略中,原子技能表现不等于组合任务完成率;最好的组合任务成功率为 16.7%。这个数字只属于所列平台、策略与测试协议,不可外推到所有机器人。

解释榜单时还要看样本边界。智源说明真机榜单因成本较高只纳入仿真榜单的一部分模型,仿真与真机任务也并非完全相同;其用于排查预训练数据污染的“开箱”测试仅覆盖两款模型。因此,这些数据更适合作为特定任务下的诊断线索,而非一张永久有效的具身模型总排名;榜单后续更新也可能改变模型名单与成绩。

资料来源与责任信息

已完成人工复核。

  1. 智源研究院:FlagEval-Robo 仿真与真机双轨评测发布说明
  2. FlagEval-BAAI: ATOM-Bench official benchmark page

返回双语互动阅读页 →