智能AI
morning
对话际数科技联创:质量赛道的先驱者,要做空间数据的「精炼厂」
摘要
编辑|冷猫 最近,有个很有意思的现象。 在山西的一个小镇里,出现了一个让人印象很深的场景:村民们戴着 GoPro,正在为大厂采集具身智能的训练数据。在山东泰安,村民们在社区的居家场景采集点,录制叠衣服、打扫卫生等家庭场景的视频数据。 「人类历史上规模最大的数据采集行动」已经拉开了帷幕。 具身就像一次全新的工业革命,而数据则是新兴智能时代的基础资源。 各大具身智能赛道的参与者都在向「现实世界」这座取...
一张图
一把尺
一个飞轮
有个很有意思的现象
在山西的一个小镇里
出现了一个让人印象很深的场景
村民们戴着
GoPro
正在为大厂采集具身智能的训练数据
在山东泰安
2026-08-03
1 阅读
约10分钟阅读
机器之心
字号:
编辑|冷猫 最近,有个很有意思的现象。 在山西的一个小镇里,出现了一个让人印象很深的场景:村民们戴着 GoPro,正在为大厂采集具身智能的训练数据。在山东泰安,村民们在社区的居家场景采集点,录制叠衣服、打扫卫生等家庭场景的视频数据。 「人类历史上规模最大的数据采集行动」已经拉开了帷幕。 具身就像一次全新的工业革命,而数据则是新兴智能时代的基础资源。 各大具身智能赛道的参与者都在向「现实世界」这座取之不尽的数据金矿中寻求原始的数据资源,甚至已经将数据采集卷入了「人民战争的汪洋大海」。 模型、算力、数据,是具身智能公认的三座大山。 当越来越多的钱和人涌向「数据采集」时,按照全民参与的比例,完成一亿小时的人类数据采集,理论上一年就够了。 可这依旧无法满足行业的需求,「数据荒」甚至愈发严重。这中间的矛盾在哪? 答案很简单,但又很复杂: 一切问题的核心在于数据质量 。采得多,不代表采得好。真正能喂进模型的数据,始终是稀缺品。 这两年,把「数据质量」挂在嘴边的公司越来越多,可真正拿得出方案、能在市场上跑通商业闭环的却寥寥无几。 际数科技 是其中少有的一个。它闯出来的一条路,恰恰是这条赛道上的新范式。 机器之心与际数科技的三位联合创始人进行了深度访谈 ,为这个「数据越多,但可用数据越少」的时代两难,找到了一个新答案,一条新路径。 「这就好比,我们本来要用互联网广袤的语言语料去训练大模型,让它涌现出智慧,」周源博士打了个比方,「结果却请一堆中学生写命题作文,喂给模型。这两个效果,天差地别。」 际数决定 把 质量判断本身做成模型 , 打造了高质量空间智能数据基础模型 ,让数据在进入下游训练之前,就能被理解、衡量和筛选。这也是他们区别于所有采集厂商、仿真厂商和具身厂商的地方。 两个金字塔:颠覆性的质量观念 周源博士用空间数据行业七年的经验告诉我们:真正能进入模型、对性能和泛化产生改善的数据,从来都是一个质量问题,数量在这里帮不上忙。 当所有人都在数量的汪洋里往前冲时,际数科技却非常罕见地关注了一个几乎没什么人在意的地方:数据,是否可信、是否可用、是否可验收、是否可复用。 过去几年,它一直默默打磨技术、在客户需求中积累经验, 做成了数据质量这个细分领域的头号玩家 。 我们一直认为,数据质量是一种「自上而下」的金字塔:数据工程的本质其实就是模型工程,是一件结果导向的事。 也就是说,质量是被结果倒推出来的。评判数据质量好坏的最终标准,是模型的表现。模型表现好,就说明数据的表现没有问题。 际数团队的世界观完全不同,因为他们是 一 支测 绘背景的团队 。 门道在于,测绘要解决的是空间数据的定位、空间关系的误差和确定性问题,它必须产出确定性极高、精度极高、误差极小的成果。所以测绘 从一开始,就把数据当成一个误差问题、一个质量问题来对待 。 为什么这么偏执?因为测绘的成果往往决定了建筑的稳定性,质量不能靠下游效果来评定。 「对空间数据的处理,一定是在上游、在采集端和处理端就把质量问题消灭掉。」 这是一种 「自下而上」的世界观 :不等下游动手,直接在数据端拦住质量问题,让下游拿到一个极度确定的数据集,性能、标准、质量都可评估、可见、可复用。 CTO 叶文凯博士讲到,数据质量是一个共性问题,「如果是单一公司或个体来探究数据质量问题的分布,它所有车型、传感器配置、技术栈都非常一致,熵非常小,就 很难泛化出对广泛质量问题的认知 。」 而这个问题只能由第三方来做。无论是具身模型还是智驾模型,每家公司从数据素材到模型本体,往往都有一套封闭、自洽的技术体系。 数据质量并不从属于某一种本体。它所涉及的问题与误差,天然跨越不同模型、不同硬件和不同应用场景,因而具有高度的共通性。 际数仅在智驾领域就已经服务过二十多家客户 ,广泛接触过不同传感器组合和不同技术路线中的数据问题。正是这种跨客户、跨系统、跨算法范式的实践积累,让际数能够跳出单一方案, 识别数据质量背后的普遍规律 。 越是封闭的单一玩家,越不可能真正解决质量这个通用问题。际数作为中立第三方,反而站在了最合适的位置上。 一个自上而下,一个自下而上,决定了际数和行业里其他玩家走上了两条完全不同的路。 一张图、一把尺、一个飞轮 际数对数据质量有深刻的理解,三板斧解决问题:一张图、一把尺、一个飞轮。 「一张图」 用测绘技术建立了精准的空间数据,对哪些因素会对质量产生正负影响,做预测和评估; 「一把尺」 是际数的误差检测模型,精度更高、信息更完整的场景基座,衡量一套观测体系在特定场景里会出现什么误差、哪些能修正; 「一个飞轮」 积累的是不同传感器、数据产品和交付场景中的质量问题与质检经验。专家判断被逐步转化为质量模型参数,用于守住最终交付质量。 这些共同构建了 际数科技在数据质量领域的技术护城河 。 从一颗火星石头,到一座质量因子库 在访谈中我们得知, 周源和叶文凯两位联创有一位共同的导师,空间信息领域大拿李荣兴教授 。李荣兴是 NASA 火星探测漫游者任务的参与科学家,长期从事行星制图与漫游者定位研究,后来回到同济大学任教。 故事发生在多年前。NASA 火星车勇气号和机遇号登陆后,因火星环境与地球测试条件不同,轮速计定位误差每天接近百米;纯视觉方案受限于地表特征稀少,也只能降到约五十米。 李荣兴团队没有继续堆算法,而是分析每块石头带来的定位误差,为不同地标分配权重,最终将误差降至一米。原本设计寿命只有 90 个火星日的机遇号,最终服役约十五年、行驶超过 45 公里。这套「寻找稳定地标控制误差」的方法,后来也被用于祝融号、嫦娥任务和极地冰盖项目。 「其实到现在我们总结,它 本质上就是一个质量贡献的因子库 。」周源说。 简单来说,质量贡献因子库,是针对场景中可能出现的物体,会对数据质量产生影响、对不同的传感器产生影响,进行定性和定量分析的数据库。 举几个简单的例子:玻璃、白墙这类高反射无纹理物体会严重干扰视觉的定位和构图;树叶这类特征多变的物体,帧间差别很大,不是好的定位特征;而雪糕桶这种视觉友好的物体,高反材质却会让激光产生多路径效应、测距失准。 掌握了这些因子,就能很轻松地分析出不同环境下能的数据质量问题。 GData Quality Factor Library (QFLab),超亿帧多模态数据积累,经由专家质检甄别千余种高质量因子。 因子库本身是一个模型 ,它训练的,是「观测结果」与「观测真值」之间的差异。 际数有着其他数据企业无法比拟的优势: 能够采用相比于数据采集更高阶的测绘技术,为场景构图定位确定真值。 这套「观测减真值」的误差量化范式,正是测绘学科区别于纯数据驱动质量评估的地方:它有一个高于被测系统的、独立的真值来源。 多模态数据处理流程,quality-aware 模型感知场景内的可靠锚点,经由 4D 重建形成时空自洽的多模态传感数据关联,进而促进下游仿真生成任务的处理效率和处理效果。 这正是来自测绘背景的技术团队的精髓和竞争力:提前把数据质量问题解出来。目前在智驾领域, 际数的因子库已经覆盖五千多公里场景 ,面向激光雷达、视觉、惯导和 GNSS 定位分别做了质量因子的积累。 大量未过检数据是宝贵的财富 但数据质量从来都不是定性的,在不同任务场景下有不同定义。大量人类主观判断
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱