开发者生态
morning
机器人手臂上的 GPT-6 Astra
摘要
GPT‑6 Astra on robotic manipulation September 4, 2026 A follow‑up to our comparison of Claude Fable 5 and Fable 5.1 . We gave OpenAI's GPT‑6 Astra control of the same YAM arms under the same Inspect R...
the
Fable
Astra
same
run
and
bowl
per
GPT
into
2026-09-06
1 阅读
约6分钟阅读
Anon84
字号:
GPT‑6 Astra 机器人操作 2026 年 9 月 4 日 我们对 Claude Fable 5 和 Fable 5.1 进行比较的后续行动。我们让 OpenAI 的 GPT-6 Astra 在相同的 Inspect Robots 代理策略下控制相同的 YAM 手臂,执行相同的两项任务:“从桌子上拿起红色块并将其放入碗中。” “通过中心的旋钮拿起圆形蓝色拼图,并将其放入板上匹配的圆形凹槽中。”在碗任务中,Astra 在 20 次试验中的 19 次中成功,而《神鬼寓言 5.1》的 20 次试验中的 8 次,《神鬼寓言 5》的 20 次试验中的 1 次,每次试验用时 2.5 分钟,而《神鬼寓言 5.1》的 6.8 分钟,每次试验的估计费用为 0.94 美元到 2.12 美元。谜题任务则是另一回事:Astra 在 20 次中完成了 2 次插入,而《神鬼寓言 5.1》则在 20 次中完成了 2 次。它达到了最佳状态,并在与《神鬼寓言》相同的最后一步中停止,每次运行从 1.36 美元到 2.18 美元。进入碗中:每个模型的最佳完成运行(最高阶段,然后是最短阶段),每个模型都以相同的加速在自己的时间内进行。计时器显示实际经过的时间,消除了思考停顿。 Astra 完成碗任务的频率要高得多,每次运行成本约为一半 2026-09-04T18:50:02.475437 image/svg+xml Matplotlib v3.11.1, https://matplotlib.org/ $1 $2 $3 0 20 40 60 80 100 完成率 (%) Fable 5 Fable 5.1 GPT-6 Astra 2.4× 更高的完成率 2.3× 更便宜 块放入碗中 $1 $2 $3 寓言 5 寓言 5.1 GPT-6 Astra 相同的完成率 1.6× 更便宜 将拼图块放入槽中 估计每次运行的成本(美元,标价) 大点是条件平均值;微弱的点是单独的试验(如果完成则为 100,否则为 0),费用由自己承担。评分 每次试验均由人类评分员根据其达到的最高阶段进行评分,因此失败的运行仍会记录其达到的程度。 《寓言》报告的标题没有变化。 0 没有有目的的接近 1 与物体接触 2 将物体提离桌子 3 将其放置在存放点上方 4 将其放置在最终位置 Astra 几乎每次都会放置方块;在拼图上,它停在《寓言》所做的地方 2026-09-04T18:50:02.444943 image/svg+xml Matplotlib v3.11.1,https://matplotlib.org/ Fable 5 (n=20) Fable 5.1 (n=20) GPT-6 Astra (n=20) 2 13 3 2 6 2 2 8 19放入碗中 0 20 40 60 80 100 试验份额 (%) 神鬼寓言 5 (n=20) 神鬼寓言 5.1 (n=20) GPT-6 Astra (n=20) 2 11 2 5 4 4 9 2 3 6 8 2 将拼图块放入凹槽 0 不接近 1 接触 2 抬起 3 定位 4 放置 每个模型达到每个阶段的试验份额;每行 n 是该单元格中的试验次数。结果 所有运行 每次计数试验,总共 120 次。技术规格 实施例 双手动 I2RT YAM 臂,每臂 6 个自由度,带平行钳口夹具 控制 绝对末端执行器姿势 ( move_to ):每臂 x、y、z、偏航、俯仰、滚动和夹具。机器人的 IK 将姿势转换为关节角度。观察 三个摄像头视图(顶部、左手腕、右手腕)加上本体感受状态,每次转动 策略代理策略、中等思维努力、20-LLM 呼叫预算、25% 速度上限、模型 gpt-6-astra、claude-fable-5 和 claude-fable-5-1 上的默认安全护栏 线束检查机器人 0.58.0 每个模型每个任务 20 次试验;所有模型的 rig-4 上的拼图,Fable 模型的 rig-3 上的碗,Astra 的 rig-1 令牌计算线路级请求和响应令牌,而不是计费令牌;按标价计算的成本,所有三种模型每百万输入/输出代币 10 美元/50 美元 限制 Astra 的试验是在《神鬼寓言》试验两天后进行的,并且没有与它们交错进行。拼图比较是在同一台设备上进行的;碗的比较不是:寓言碗试验在 rig-3 上运行,但该设备不可用。分级是由操作员根据已知模型进行判断的,因此分数容易出现无意识的偏差。成本为标价。发送人为请求时没有立即缓存; OpenAI 自动缓存了大约五分之一的 Astra 输入,这里没有打折,所以 Astra 的成本(如果有的话)被夸大了。在试验之间手动重置对象,所有模型仅以中等推理能力运行。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱