首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

OpenAI百亿投入砸向具身,机器人竞争进入数据与算力时代

摘要

机器之心发布 近日,一份发表在 GitHub 上匿名的仿真测评报告,在具身智能圈投下了一枚深水炸弹: 混合 GPT-6 Astra 的架构 62.6 分,第二名仅 38.26 分 。 64% 的性能差距,这种差距说明已经不是微调优化了,可以说是架构层面的降维打击。 这项研究没有用 GPT-6 Astra 直接操控机械臂,它做了一件更聪明的事:用 GPT-6 Astra 提供语义层面的判断与修正,与...

Astra GPT Direct RoboDojo RoboLab 成功率 机器之心发布 一份发表在 GitHub 上匿名的仿真测评报告
2026-09-17 1 阅读 约10分钟阅读 机器之心
分享:
字号:
机器之心发布 近日,一份发表在 GitHub 上匿名的仿真测评报告,在具身智能圈投下了一枚深水炸弹: 混合 GPT-6 Astra 的架构 62.6 分,第二名仅 38.26 分 。 64% 的性能差距,这种差距说明已经不是微调优化了,可以说是架构层面的降维打击。 这项研究没有用 GPT-6 Astra 直接操控机械臂,它做了一件更聪明的事:用 GPT-6 Astra 提供语义层面的判断与修正,与 π₀.₅ 的物理空间交互及动作先验形成互补架构。 银河通用团队对 Astra 模型的深度评测揭示了其在 System 2 通用性上取得重要突破。虽然轨迹质量和实时性不高,但可以零样本在各种形态机器人上高成功率完成各类新任务,并有很强的错误恢复能力。 看起来,具身智能已经离我们不再遥远,在数万亿级的模型参数体量下,机器人的通用性已经取得了类似 ChatGPT 程度的水平飞跃。 这份测评是怎么做的? 该报告的撰写者来自银河通用团队的研究员,第一作者是银河通用创始人兼 CTO 王鹤教授的博士生。整个测评是一套严格对齐的闭环控制对比实验。 研究用两种用于仿真双臂操作的闭环控制架构进行了分析: Direct 模式:不跑 π0.5 ,GPT-6 Astra 直接看三路相机画面和机器人状态,输出双臂末端位姿和夹爪开合,每次执行 1 到 5 个控制步。 混合模式:每个决策时刻, π0.5 先生成 50步候选动作。GPT-6 Astra 看同一份画面、执行历史,还有候选动作对应的双臂轨迹,然后二选一:要么沿用 π0.5 的前 1 到 15 步,要么自己出 1 到 5 步末端位姿修正。走完这一段,再看新画面,重新决定。 这个架构其实非常简单。一作在报告里也提到,这种“候选动作挑选”的 TopK 思路,在业内交流中已经被多次讨论过。但真正把它跑出量级差异的,这是第一次。 结果显示混合模式拿下 48% 成功率和 62.60 平均分,平均分甚至大幅超出第二名 64%。 01 RoboDojo: 混合 GPT-6 Astra 后大幅提升成功率 首先是 RoboDojo 实验。 团队选取了 10 类复杂机器人操作任务,包括整理桌面、根据语言分类物体、排序数字、装箱、搭塔、麻将杠牌、叠衣服和瓶子入桶等,每个任务进行 5 次测试,共 50 次。 实验设置了两种方案。 一种是 GPT-6 Astra Direct ,由 Astra 直接根据视觉、本体状态和任务目标生成机器人动作;另一种是 π0.5+Astra ,由机器人 VLA 模型 π0.5 提供动作,Astra 观察环境和候选动作,并在必要时进行修正。 结果差异明显。 Astra Direct 在 50 次任务中成功 13 次,成功率为 26% ,48 个具有完整原生评分的任务平均得分为 37.81 。 接入 π0.5 后,成功次数提高到 24 次,成功率达到 48% ,平均得分升至 62.60 。更值得注意的是,Astra 只修改了全部执行控制步骤中的 14.4% 。 也就是说,大部分动作仍由 π0.5 完成,Astra 主要在关键节点负责理解任务、判断当前状态,以及决定是否需要修正。 这组实验首先说明,两类模型具有明显的互补性。 Astra 最擅长的是语义理解、视觉识别、空间关系判断和任务规划。在“物体分类”等任务中,Astra Direct 甚至取得 100 分;面对抓取失败、物体遗漏或环境发生变化,它还能够重新观察现场,再决定下一步行动。 但到了搭塔、麻将杠牌等需要精细接触、稳定抓取和连续控制的任务,大模型的短板迅速暴露。 Astra Direct 在搭塔任务中平均只有 12 分 ,麻将杠牌为 0 分 。模型可以知道木块应该放在哪里,却未必能够稳定控制落点、摩擦和碰撞。 加入 π0.5 之后,搭塔从 12 分提高到 64 分,麻将杠牌从 0 提高到 40,叠衣服和瓶子入桶等任务也明显改善。 这是报告最重要的一层信息:大模型已经能够进入机器人策略层,但对物理世界的理解和对物理世界的操作,仍然是两种不同的能力。 02 RoboLab:在带语义理解任务上能力进一步验证 RoboLab 实验进一步展示了 Astra 在另一类任务上的优势,考察通用机器人策略对视觉、物体关系、任务指令和空间结构的理解。团队从中选取 10 类任务,每类进行 5 次评测,共 50 次,包括将方块放入容器、在杂物中寻找并移动南瓜、按照指定顺序堆叠积木、调整杯子朝向,以及把不同物体放入指定位置等。 结果非常突出。 GPT-6 Astra Direct 在 50 次实验中成功 49 次,成功率 98%;Astra+π0.5 完成 46 次,成功率 92%。作为参考,同一组统计中的 π0.5 完成 18 次,Cosmos3-Nano-Policy 完成 18 次,DreamZero 完成 17 次。 尤其值得注意的是,Astra 没有针对这些具体任务额外训练。模型根据当前画面、机器人状态和自然语言任务描述,持续判断下一步应该如何操作。 从逐任务结果看,Astra 在多个任务中实现 5 次全部成功,包括方块入箱、杂物中处理南瓜、按照关系摆放物体、按指定顺序堆叠、重新调整杯子方向等。唯一没有全部成功的是“大号葡萄干盒放入容器”,5 次完成 4 次。 这组实验展示出的核心能力,是 零样本泛化 。模型能够识别目标、理解空间关系,将语言要求转化为动作,并在环境变化后继续调整策略。 不过,这一数字需要结合实验口径理解。报告明确说明,RoboLab 实验只选取了 10 个任务、每种方法每个任务 5 个最终评测槽位,并非完整 RoboLab 排行榜复现;历史基线与 Astra 也没有严格保证完全相同的初始状态和控制配置,部分 Astra 实验包含授权重试。 因此,98% 更适合用来观察 Astra 在这些任务上的能力上限,不能简单作为严格同条件排行榜成绩。 03 GPT-6 Astra 强在理解任务和发现“哪里不对” 回到 RoboDojo 的逐任务结果,还能进一步看清它究竟强在哪里。 在“物体分类”任务中,Astra Direct 得到 100 分,5 次全部成功;“按语言分类”平均得分达到 60,成功率 40%;“排出最大数字”得分 57。 Score 热力表成功率热力表。 这些任务高度依赖语言理解、视觉识别、关系推理和目标规划,恰好是大模型擅长的能力。 实验中还出现了大量传统机器人策略较少展示的行为。 例如模型发现一次抓取姿态不理想后,会主动改变接近方式;物体大致摆好后,它会重新观察环境,发现任务实际上尚未完成,并继续调整;在装箱过程中,它能够发现箱子后面还有遗漏物体;当原计划执行受阻时,也会根据新的视觉反馈重新规划。 图:实验中,Astra 会根据执行后的新画面继续判断任务状态,并在必要时调整动作。例如在物体分类任务中,模型发现当前抓取需要局部修正;在装箱等长程任务中,模型会持续检查场景中的剩余目标,再决定后续动作。 数字摆放任务中也出现了很精彩的恢复:模型在运动受阻后重新理解机械臂的控制反馈,调整动作并继续执行。它展示了 GPT-6 Astra 对控制约束的局部适应能力,而不只是被动地重复失败命令。 图:数字摆
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱