首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

具身智能仿真「竞技场」RoboColiseum来了:真机对齐度近90%,已有40+团队同场打擂

2026-08-14 1 阅读 约7分钟阅读 机器之心
分享:
字号:
机器之心发布 当前,具身智能领域正经历着模型架构与算法的快速迭代。然而,在模型数量激增的同时,“评测标尺缺位”的痛点也日益凸显:行业缺乏统一、可复现且能真实反映模型能力的评测基准,开发者往往难以准确衡量模型的真实边界与具体短板。 针对这一行业共性难题, 8 月 14 日,常态化具身智能仿真评测平台 RoboColiseum 发布。该平台旨在构建多维度的系统评测体系,以与真机表现高度一致的仿真评测,帮助开发者识别模型的能力优势与短板,持续迭代提升。平台面向全球高校、科研机构、模型企业与研究者开放,实时更新评测结果,致力于构建一套结果可信、过程可复现的具身模型评测标尺。 RoboColiseum 自内测上线以来,已有海内外 40 多支队伍在平台开展模型训练与评测。 仿真评测平台:http://robocoliseum.ai/ 聚焦 Sim2Real 瓶颈 建立高保真仿真与实机对齐 模型在仿真环境中的优异表现,能否延续到真实物理世界?进入现实场景后,光照、材质、相机噪声、物体接触以及机器人初始位置和姿态的变化,都可能导致模型性能下降。因此,如何通过仿真评测准确衡量模型的真实能力,仍是一个关键难题。 RoboColiseum 基于高保真仿真环境构建,在环境渲染和物理交互方面高度还原真实世界。经实测验证, 仿真评测与实机部署的相关性达到 89.5%,相同模型在仿真环境与真实世界中的评测差异小于 10% 。仿真评测由此可以作为真机表现的可靠参考,帮助开发者在进入成本更高、周期更长的真机测试前,快速完成模型筛选与问题定位。 这一验证链路也是双向的:使用真机数据训练的模型可以直接提交仿真评测,仿真数据训练的模型也能够通过真实机器人验证迁移效果。虚拟环境与真实世界由此实现双向打通,让开发者能够以更低成本获得高置信度结论,显著缩短 “训练 — 评测 — 改进 — 部署” 的迭代周期。 仿真环境高度还原真实世界 Sim2Real 实验对比 告别单一成功率指标 构建四维细粒度归因体系 传统评测往往用一套综合成功率概括模型表现,RoboColiseum 则围绕不同能力维度设置多个任务集,考察模型在各个维度中的表现。目前, 平台已推出 4 类能力子榜、78 个高保真仿真评测任务。未来还会结合产学研需求,持续更新任务和评测维度 。 4 类能力子榜: 指令跟随(Instruction Following),考察模型能否理解颜色、数量、形状、尺寸、类别、逻辑与常识等自然语言信息,找对目标并执行正确动作。 空间理解(Spatial Reasoning),检验模型对绝对位置、相对关系、尺寸与序号排序、堆叠和空间对齐等信息的理解能力。 扰动适应(Robustness),通过改变背景、光照、材质、机器人初始状态、相机位置与图像质量,并对指令进行多样化改写,检验模型在非理想环境中的稳定性与泛化能力。 通用操作(General Manipulation),覆盖开门、倾倒、舀取、上货、分拣、整理桌面和双臂协作等多步骤任务,衡量模型组合运用原子操作技能的能力。 为了让失败原因可追溯,每项任务都会被进一步拆解为多个子步骤。评测平台不仅判断最终任务是否成功,也会记录模型完成了哪些步骤、在哪一步失败以及在不同场景中的泛化能力。 在评测设计上,RoboColiseum 通过大规模、多样化样本降低单次测试的偶然性,并采用域随机化、训练集与测试集隔离、分布内与分布外测试等机制,减少模型依赖固定布局或数据规律 “走捷径” 的可能,提高评测结果的稳定性。 四维评测体系 AI agent 一键提交 30 分钟获得评测结果 对于开发者而言,高质量评测往往伴随着复杂的环境配置、资产适配和算力成本,搭建完整评测链路耗时耗力。 RoboColiseum 将这些环节封装为一套自动化服务。开发者从注册到提交最快仅需 5 分钟,一键部署模型,最快 30 分钟即可完成仿真评测。平台将自动返回分项成绩、任务步骤结果及模型推演视频,直观呈现机器人在每个任务中的执行过程。 借助 AI Agent,开发者还可通过自然语言对话完成数据下载、模型训练、本地验证和评测提交。 模型代码和权重无需上传,只需在本地部署推理服务并接入标准接口,即可连接平台开展评测。 5 分钟提交注册,30 分钟获得评测结果 引入主流模型基线 开发者可自行复现 RoboColiseum 已 提供 ACoT-VLA、π0、π0.5、GR00T 等国际具身基座模型的基线成绩 。开发者提交自己的模型后,即可在四个维度上与主流模型进行逐项比较,快速判断自身优势与不足。 同时,RoboColiseum 提供各基线模型在平台任务上的训练代码及对应权重,开发者可自行复现训练与评测过程、核验基线成绩,并在统一条件下开展模型对比与后续研究。 RoboColiseum 的名字从何而来? Coliseum 原指古罗马圆形竞技场, 一个公开、中立、谁都可以登台的竞技场 。RoboColiseum,既是模型同场比较的 “竞技场”,也是开发者反复测试、定位短板和持续迭代的 “训练场”。 平台的长期目标,是将真实世界中的复杂任务转化为标准化、可复现、可持续更新的评测体系,让评测成为具身模型研发流程中的基础工具。 当模型能够在同一把尺子下比较和改进,具身智能的发展也将从精心挑选的成功演示,走向更加可靠、透明和可验证的真实进步。平台也期待更多开发者开放模型,共建具身智能生态。 RoboColiseum 现已正式开放,欢迎全球开发者入场! © THE END 转载请联系本公众号获得授权 投稿或寻求报道:liyazhou@jiqizhixin.com
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱