智能AI
morning
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队
摘要
通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队 鹭羽 2026-09-16 21:08:20 来源: 量子位 鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI 来了!这一次, 国产多模态 在物理世界也夯起来了—— 九大国际权威空间理解基准测试中, 八项断档第一 ,通用能力还能不打折。 紫东太初最新开源的通用多模态大模型 ZDTaichu5.0...
ZDTaichu5
视频链接
https
weixin
com
aBak5FZaC6nhGpwkeL8hAg
实测由紫东太初完成
量子位
通用能力不打折
空间具身智能断层领先
2026-09-17
1 阅读
约9分钟阅读
鹭羽
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 通用能力不打折,空间具身智能断层领先!ZDTaichu5.0-9B国产开源,跻身全球多模态第一梯队 鹭羽 2026-09-16 21:08:20 来源: 量子位 鹭羽 发自 凹非寺 量子位 | 公众号 QbitAI 来了!这一次, 国产多模态 在物理世界也夯起来了—— 九大国际权威空间理解基准测试中, 八项断档第一 ,通用能力还能不打折。 紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B ,直接把10B以下通用模型空间具身的天花板又往上顶了一大截。 这里可能就有朋友要问了,让多模态看懂真实世界,为啥值得单拎出来说? 一个字: 难! 过去的多模态模型,已经能把一张图片理解得头头是道,但一旦走进真实物理世界,空间理解与行动能力往往就跟不上;而一些模型为了补足空间能力,又不得不以牺牲通用能力为代价。 能同时跑通这两件事的模型寥寥无几,效果还突出的更是凤毛麟角。 紫东太初就是其中之一,ZDTaichu5.0-9B堪称 全能 。 眼见为实,咱们直接上效果。 视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg 这是一段由 ZDTaichu5.0-9B 控制的美工刀具身收纳演示。 如果让人来做,应当是个非常简单的过程: 拉开抽屉→放进去→再关闭 。但具身不一样,一连串的动作背后都是相当细致的空间判断。 刀柄在哪里?抽屉状态如何?夹爪有没有对准? 每一步都要承接住上一步带来的变化,动作才能看起来顺,这对模型能力的考验是极为苛刻的,而ZDTaichu5.0-9B已经能完成 复杂的空间理解和高层任务规划 。 与此同时,对于这个只有9B大小的模型,其图文理解、文字识别、数学推理和代码能力也依旧稳居 第一梯队 。 通用能力不降级,空间具身能力向上突破。 很好奇,究竟是如何做到的? 空间具身+多模态双领先 在回答这个问题之前,咱们不妨再多看几个效果感受感受。 先来几道空间具身题目尝个鲜。 从视频目标定位到三视角推理,空间判断稳准狠 第一道题 「找东西」 :从左至右,找到第二个银色盒子。 这个 空间感知任务 对于机器人来说,是后续执行任务的大前提。指错了,后面的抓取动作再准确,执行的也是另一个任务。 视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg △实测由紫东太初完成 画面中,台面挤满杯子、收纳容器和各种杂物,干扰项较多。模型得同时读懂银色这个关键属性、盒子这个对象,以及从左到右第二个这层空间排列关系。 从对比演示中看,ZDTaichu5.0-9B给出的 归一化坐标 (237,226)最为精准,落在目标标注区域内。 接下来难度升级,不仅要找得对,也要看得准。 这是道考验复杂空间推理的 「看位置」 题。 视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg △实测由紫东太初完成 输入的是同一房间的三个视角。模型需要设想自己移动到绿框窗帘所在的位置,面向蓝框沙发,再判断红框柜子相对自己的方位。 其中模型得把不同画面中的对象一一对应起来,再根据新的观察位置和朝向转换参照系。 ZDTaichu5.0-9B给出了右前方, 预测完全正确 。 再往前一步,空间判断还得回答哪里具备操作条件,给予机器人接下来的操作以方便。 比如这道 「找空位」 ,要求在最右侧杯子的杯柄方向上,找一块空闲区域。 认出杯子只是开始,随后还要确定杯柄朝向,检查旁边是否被其他物体占用。 视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg △实测由紫东太初完成 结果也不出所料,ZDTaichu5.0-9B依旧稳稳 落入正确区域 。 当我们把三个例子放在一起看,它们分别对应目标选择、参照系转换和交互条件判断,都在机器人执行真实物理任务中扮演关键要素。 换言之,这些基础能力都决定着 具身能否从一句任务指令到真正可执行 。 再来看 完整成绩单 ,模型优势就更加清晰了。 在所列的10B档位开闭源模型中,ZDTaichu5.0-9B几乎是 断层领先 。 比如差距较大的MindCube-tiny,ZDTaichu5.0-9B的得分是78.27分,Gemma4 8B-E4B、Gemini 3 Pro和Grok 4分别是48.8462、70.87和63.56。 整个榜单把 空间感知、三维推理、多视角变换、具身交互 都囊括在内了,可谓是面面俱到,足见ZDTaichu5.0-9B已彻底看懂物理场景该怎么操作。 双线突破,通用能力不降级 考完空间能力之后,另一个重要问题随之而来: 通用能力 还hold得住吗? 这里同样有份基础能力的成绩单。 图解理解基准AI2D达到 91.48分 ,仅次于Gemini 3 Pro,高于其它所有对照模型。 WeMath为75.9分,同样领先;MathVista Mini为84.5分、OCRBench为85.5分,表现颇具竞争力。 除此之外,ZDTaichu5.0-9B在 Agent与文本任务 上也依旧表现突出,尤其是代码成绩。 这些能力具体怎么组合起来用, 科研Agent 的阻尼振子求解demo给出了直观展示。 该问题要求Agent组织解析求解与Python/SciPy数值计算,并对照两种结果,最后生成相空间图、位移与速度曲线,以及分析报告。 ZDTaichu5.0-9B在整个过程中也丝毫没有掉链子,在问题理解、代码执行、结果核对和图表输出四个阶段子任务上都完美实现连续衔接,最后输出非常完整。 视频链接:https://mp.weixin.qq.com/s/aBak5FZaC6nhGpwkeL8hAg 事实上,这对于同一个9B模型是相当不容易的。 要同时兼顾 空间具身能力与通用能力 两条线,背后要解决的有很多,例如数据如何组织,以及复杂判断时算力怎么分配。 9B多模态大模型的空间具身能力,是怎样练成的? ZDTaichu5.0-9B给出的解法贯穿 训练 和 推理 两部分。 全栈数据生产管线:把通用能力、Agent能力以及空间具身能力全部练进模型 紫东太初先是围绕这一需求,组织了一套 经过全流程验证 、 可复用 、 可迁移 的数据工程链路。 整体包括三个渐进式成长阶段: Step 1:预训练数据管线。 这一步数据覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。 原始素材进入管线后,先通过 感知哈希 与 URL 去重,再过滤低清晰度、图文不相关等较差的样本,随后进行内容重写解析和视频抽帧描述,最终打包组织成可训练的图文与时序输入。 最终建立的是视觉、语言、时序和空间概念之间的对齐联系。 Step 2:监督微调数据管线。 随后训练开始覆盖完整任务。 开源SFT指令、真实业务问答、空间具身案例,以及Agent工具调用轨迹,都被组织成多轮对话、多图和视频序列。 其中针
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱