智能AI
morning
开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一
摘要
编辑|陈陈 紫东太初开源的这个通用多模态大模型 ZDTaichu5.0-9B ,简直夯爆了! 虽然参数只有 9B,却在空间具身智能这条赛道上跑到了前列。 9 项国际权威空间理解基准中拿下 8 项同参数通用组别第一 ,在空间感知、跨视角三维推理、具身任务规划等指标上优于 Qwen3.5-9B、STEP3-VL-10B 等模型,即使加入 Gemini 3 Pro、Grok 4 等闭源模型,仍在 5 项...
ZDTaichu5
https
STEP3
10B
跨视角三维推理
Qwen3
Gemini
Pro
Agent
github
2026-09-18
1 阅读
约10分钟阅读
机器之心
字号:
编辑|陈陈 紫东太初开源的这个通用多模态大模型 ZDTaichu5.0-9B ,简直夯爆了! 虽然参数只有 9B,却在空间具身智能这条赛道上跑到了前列。 9 项国际权威空间理解基准中拿下 8 项同参数通用组别第一 ,在空间感知、跨视角三维推理、具身任务规划等指标上优于 Qwen3.5-9B、STEP3-VL-10B 等模型,即使加入 Gemini 3 Pro、Grok 4 等闭源模型,仍在 5 项基准上取得最高分。 不仅如此, 该模型在图文理解、OCR、视觉数学、代码 以及 Agent 等通用多模态能力评测中,同样保持第一梯队 。 通用能力榜单 在 11 项 Agent、代码、指令遵循和数学推理测试中 ,也表现出比 Qwen3.5-9B、STEP3-VL-10B、gemma4-8B-E4B 等同量级开源模型的优越性。尤其在 TAU2-Bench 和 IFEval 上,其成绩还略高于 Gemini 3 Pro。 AGENT 和文本榜单 Blog: https://taichu-ai.github.io/ZDTaichu5.0-9B Huggingface: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B Modelscope: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B Github: https://github.com/Taichu-AI/ZDTaichu5.0-9B/ 伴随模型开源的,紫东太初还公布了 ZDTaichu5.0-9B 背后的技术路线: 自适应循环推理 ,该技术与大家猜测的前沿闭源模型 GPT‑6 Astra 使用的 Loop Transformer 技术采取类似的路线 ,展现出团队极高的技术前瞻性。 另外,紫东太初同步开放了一整套经过验证的 数据生产管线详细方案 ,覆盖预训练、监督微调、高质量退火和 GRPO 强化学习等环节。 通用多模态模型进物理世界,卡在哪里? 这背后对应的是一个正在发生的变化: 过去几年,通用多模态大模型在数字世界的能力提升速度有目共睹,图文理解、复杂视觉问答、跨模态推理,这些任务的评测分数逐渐逼近饱和。 但物理世界是另一回事。 一个机器人面对操作台上的工件,需要同时完成:看清楚目标在哪(空间感知)、换了视角之后还能认出来并判断空间关系(跨视角三维推理)、给出一个不违反物理约束的操作方案(具身推理)。这些能力,在数字世界的多模态评测里几乎不会同时考到,但在物理现场,它们必须同时在线,缺任何一层,任务链条就会在某个节点断掉。 更麻烦的是,空间具身所需的三维关系标注、操作约束数据,和通用多模态的图文数据在分布上差异较大,两类数据混在一起训练,模型很容易在参数受限时顾此失彼。 再就是推理机制:空间推理任务内在地存在难度不均匀性,有的判断一步就能得出,有的(比如参照系变换、多物体相对关系推演)需要更深的迭代计算,但传统模型的算力分配是线性的,不管题目难不难,消耗的计算资源基本一致,这在参数有限的小模型上,是一个真实的瓶颈。 ZDTaichu5.0-9B 的解法是用一套完整的数据生产管线解决数据侧的问题,用自适应循环推理机制解决复杂推理以及算力分配的问题。 结果是,空间具身能力跃升,通用能力不降级。 具体结果如何?我们接着往下看。 10B 档位空间具身能力通用第一,通用多模态大模型迈向物理世界 ZDTaichu5.0-9B 的空间具身能力提升, 首先体现在复杂空间理解任务上 。 给定一张图或一段视频,模型能不能精准定位目标物体的坐标?要求模型同时理解物体属性、空间排序、位置信息三个维度。 实测里,ZDTaichu5.0-9B 准确输出了归一化坐标并精准命中真值,而参与对比的同级开源模型全部定位错误,ZDTaichu5.0-9B 是唯一完成正确目标选择的模型。 寻找从左到右第二个银色盒子。 第二层:参照系转换 。真实环境中的机器人,很少保持固定视角。机器人移动之后,摄像头位置变化,原本建立的空间关系也会发生变化。模型需要理解这种变化来自观察角度改变,而不是物体本身移动。 典型任务是要求模型先移动到某个参照物位置、转向面对另一个参照物,再判断第三个物体相对自身的方位。在示例中,ZDTaichu5.0-9B 给出了正确的方位判断。 三视角推理 —— 指令要求移动至绿框窗帘位置、面向蓝框沙发,判断红框柜子相对自身方位。 MindCube-tiny 这一榜单要求模型在脑中构建三维心智地图, 完成复杂的物体关系推演 。ZDTaichu5.0-9B 78.27 对 Qwen 的 57.6、STEP3 的 62.8,差距超过 15-20 个点。这个数字背后还有很重要的意义,因为 MindCube 本质上在测模型有没有真正建立三维空间表征,而不是在做简单的语义匹配。 ERQA 和 RoboSpatial 是 具身交互理解的核心基准 ,测的除了物体在哪里,还有我能不能对它做操作以及该如何操作。放置任务要求模型判断可放区域:找到杯柄侧的空闲位置。ZDTaichu5.0-9B 输出坐标落在合理区域,Qwen 和 STEP3 输出坐标全部落在不符合要求区域。这个差距说明其他模型根本没有完成操作约束的空间推理,只是在做一个位置猜测。 把这几个维度连起来看,你会发现一条完整的能力链条:静态感知→动态定位→跨视角转换→三维推演→具身条件判断→交互决策。每一层都比上一层难一个数量级,而且缺任何一层,机器人在真实场景里都会在某个步骤失效。ZDTaichu5.0-9B 在这条链条上 8/9 拿到同参数通用组别第一,并且还不损失通用能力,表现出结构性领先。 另外,在真实物理环境中,机器人需要面对一连串相互依赖的任务流程。 这类长程任务要求模型需要持续记住目标对象、空间位置、已完成步骤以及当前任务进度,并根据新的环境反馈不断更新判断。 ZDTaichu5.0-9B 在美工刀收纳任务中,体现了这种持续状态理解能力。 那么,紫东太初究竟做对了什么,才能让一个 9B 模型在通用多模态能力上保持第一梯队,同时在空间具身任务中展现出同档位领先表现? 这背后,是模型推理机制与数据工程体系的共同作用。 自适应循环推理:把算力用在 「 难 」 的问题上 先说推理机制,这是 ZDTaichu5.0-9B 和当前其他路线最核心的技术分岔点。 现在市面上处理复杂推理的主流方案有两种:一是思维链(CoT),让模型在输出层面多想几步;二是外部工具调用,遇到难问题调用外部计算模块。 但对于物理世界任务而言,这两种方式都有局限。 CoT 更适合数学、代码等符号推理任务,而机器人面对的是持续变化的三维环境,很多判断依赖视觉状态和空间关系,并不能简单拆解成线性的语言推理步骤。 工具调用虽然能够扩展模型能力,但会增加系统复杂度和执行延迟。在实时交互场景中,模型需要快速判断环境变化,并动态调整行动策略,而不是等待多轮外部调用。 这正是 ZDTaichu5.0-9B 自适应循环推理 试图解决的问题。 该机制让模型自己判断这道题有没有把握:模型在完成一次标准前向计算后,会通过熵门控机制评估当前预测结果的不确定性,如果结果比较确
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱