智能AI
morning
刚刚,中国队9B「全能王」开源登场!横扫8项全球通用第一
摘要
新智元报道 10B参数以内,空间具身能力同档第一的通用多模态大模型来了! 就在昨天, 紫东太初正式开源ZDTaichu5.0-9B ,新一代面向物理世界的通用多模态大模型。 一出手,就横扫九大国际权威空间基准,拿下8项同参数通用组别全球第一。 最拉开差距的,是复杂空间推演。 MindCube-tiny上,它拿到78.27分,甩开Qwen3.5-9B整整20.67个百分点,比STEP3-VL-10B...
ZDTaichu5
Qwen3
新智元报道
10B参数以内
空间具身能力同档第一的通用多模态大模型来了
就在昨天
紫东太初正式开源ZDTaichu5
新一代面向物理世界的通用多模态大模型
一出手
就横扫九大国际权威空间基准
2026-09-16
1 阅读
约10分钟阅读
新智元
字号:
新智元报道 10B参数以内,空间具身能力同档第一的通用多模态大模型来了! 就在昨天, 紫东太初正式开源ZDTaichu5.0-9B ,新一代面向物理世界的通用多模态大模型。 一出手,就横扫九大国际权威空间基准,拿下8项同参数通用组别全球第一。 最拉开差距的,是复杂空间推演。 MindCube-tiny上,它拿到78.27分,甩开Qwen3.5-9B整整20.67个百分点,比STEP3-VL-10B也高出15.46个百分点。 而且,它把空间能力拉上来的同时,图文、OCR、数学、代码这些通用能力,也没落下。 到了真实任务里,这两头还真缺一不可。工单得读懂,工位也得看明白。 读懂「把东西放过去」只是开始。AI还得继续判断:换个位置该往哪走,伸手之前哪里能放,做完一步之后接下来怎么办。 这个9B模型,要补上的就是AI走进物理世界时,最容易掉链子的那一段。 奥特曼要造「大脑」,难在哪里? 这颗「大脑」有多难造?奥特曼的一番话,点中了关键。 9月初,一场播客中,他直接把话挑明,「OpenAI肯定会做人形机器人」! 在他看来,比机身形态更重要的,是搞定让机器人真正干活的那个「大脑」。 这句话,恰恰点中了具身智能最难啃的部分。 一副机械臂可以反复执行写好的动作。可工位换了,零件挪了,任务做到一半被打断了,接下来怎么办? 总不能每变一次,就让工程师重新教一遍。 这就把问题推到了空间理解上,指令听懂了,还得判断眼前的东西在哪、怎么摆、能不能操作。 认出画面里有个杯子,只回答了「是什么」;判断杯柄朝哪、旁边能不能放东西,才开始接近「能做什么」。 任务一旦拉长,这些判断还得接上。 东西拿起来了,身份得记住;容器打开了,状态要更新。前面一个判断没跟上,后面就可能越做越偏。 ZDTaichu5.0-9B这颗大脑,到底能不能应对这些变化? 接下来,直接看三道对比题。 三题连过,同级全翻车 以下三道题的难度是递进的,正好对应机器人从「看见」到「动手」要过的三关。 第一题:换个位置,柜子还找得着吗? 给到的要求是,移动到绿框窗帘的位置,面向蓝框沙发,判断红框柜子相对自己的方位。 窗帘、沙发、柜子,全在画面里。难点在于,题目要求换一个地方站,再转一个方向看。 原图里的「左」,未必还是新位置上的「左」。 看起来像一道找方向的小题,实际要求模型连续处理两次变化:先改变站位,再改变朝向。 人会在脑子里转一下房间。模型也得完成同样的参照系转换:先把自己「搬」到窗帘前,再把视线对准沙发,最后重新推算柜子落在新坐标系的哪个方向。三步里任何一步串了,答案就反了。 这背后是参照系变换(frame of reference transformation) 问题。 模型必须同时维护三套坐标:世界坐标系、本体坐标系、相机坐标系,并在视角切换时完成三者之间的映射。 多数模型的做法是把每帧图像独立编码成视觉Token,再靠语言先验「猜」方位——一旦相机位姿变了,视觉Token 之间的空间拓扑关系没有显式建模,关系就断了。 ZDTaichu5.0‑9B给出正确答案「右前方」。Qwen3.5‑9B和STEP3‑VL‑10B都发生了参照系错乱,给出「右、上、后方」这类错误答案。 它考的,恰恰是移动机器人绕不开的能力。摄像头一转,物体在画面里的坐标就变了。 绝大多数多模态模型在这一刻会丢掉空间拓扑:刚才还记得柜子在沙发左边,机器人挪两步,关系就散了。如果每换一个视角就把空间关系认错,后面规划得再漂亮,也可能走反方向。 第二题:方位算清了,目标能选对吗? 指令很短:找到「从左到右第二个银色盒子」。 短,不代表简单。 模型要同时干三件事:认出哪些是银色的(属性),把它们按从左到右排好(顺序),还要能真正给出目标的位置。 三件事缺一件,抓错的就是隔壁那个盒子。 技术上,这是一道属性绑定+空间排序+位置输出的复合题。 模型需要把「银色」这个视觉属性、「第二个」这个序数关系、「从左到右」这个空间方向,绑定到同一个目标实例上,并精准输出目标物体的位置坐标。 序数关系尤其棘手:它依赖对整排物体的完整枚举和相对位置排序,而不是孤立地识别某一个盒子。 ZDTaichu5.0‑9B输出归一化坐标 [237,226],精准命中数据集真值。 Qwen3.5‑9B给的是 [360,280],STEP3‑VL‑10B 给的是 [327,220],都指错了盒子。同级通用开源模型里,只有它选对了目标。 放到车间里,这道题有个更熟悉的名字:密集货架上一排外观几乎一样的料盒,工单说「取第三排第二个」。机器人抓取的第一步不是伸手,而是选对目标。 目标选错,后面的抓取再精准也是白忙。 第三题:目标找到了,旁边真能放东西吗? 前两题解决了方位和目标,这次要进一步判断操作条件:找出杯柄那一侧的空闲区域,给出一个能放东西的点。 这道题的门槛在于,模型不能只回答「杯子在哪」,还得回答「杯子怎么摆的」「它旁边哪块是空的」。 拆开看是三步:先识别目标杯子,再解析它的姿态、确定杯柄朝向,最后校验邻近区域有没有被别的物体占着,才能输出一个可用点位。 这本质上是可供性推理(affordance reasoning) 加空间约束校验。 模型要输出的是一个连续空间中的合法点位,而不是一个类别标签。 这意味着它必须理解物体的三维姿态(杯柄朝哪边)、理解「空闲」的物理含义(没有被其他物体占据)、并把这两者合成为一个可执行的坐标。 很多模型能识别杯子,却给不出「杯柄侧旁边那块空地」的坐标,因为它缺的是从语义识别到空间决策的最后一跳。 ZDTaichu5.0‑9B给出坐标 [650,720],完全落在合理空闲区域。Qwen3.5‑9B和STEP3‑VL‑10B给出的坐标,全部落进了不合要求的区域。 换句话说,机器人真按它们的答案放下去,东西会压在别的物体上。 识别是「知道有什么」,交互是「知道能做什么」。 前者只是看图,后者才是动手前的最后一道判断。市面上不少模型在前一层表现不错,到这一层就开始给出不可执行的答案。 三道题,正好是一条递进的链:空间感知、复杂三维推理、具身条件判断,最后落到物理交互决策。 不过,空间判断做对了,还不足以接下完整任务。 机器人要知道往哪里放,也得先读懂工单、理解规则,必要时调用工具。 空间能力上去了,通用能力一分没掉 这就带来另一个问题—— 把模型往空间和具身方向训练,原本擅长的图文理解、OCR、数学和代码能力,还能不能保住? 如果连工单都读不明白,方位算得再准,也不知道该干什么。再配一个通用模型?两个模型怎么分工、怎么传信息,又是一摊要解决的事。 所以,ZDTaichu5.0-9B要的很明确:空间能力练上去,通用本事也得留住。 先看读图、算题、认字这些基本功:AI2D拿到91.48分,WeMath为75.9分,MathVista Mini为84.5分,OCRBench为85.5分。 看懂示意图、读出工单文字、算清图里的数量关系,都得靠这些基本功。 在多项空间能力基准测试上,ZDTaichu5.0-9B胜过了多模态模型Gemini 3 Pro,比如ViewSpatial、MindCube-tiny、VSI-Bench成绩领先7%以上。 同时在文本智能体与代码能力上,IFEval(93.7)、AI
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱