智能AI
morning
3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知
摘要
3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知 田, 晏林 2026-08-10 09:12:33 来源: 量子位 从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 具身智能圈,又传来两条重磅消息。 8月6日,Om AI联汇完成 数亿元融资 ,前海母基金领投。 同一天,该公司...
量子位
端侧原生
3B模型碾压英伟达谷歌后
AI端侧原生VLX模型
小参数实现物理世界精准感知
2026
从云计算到云原生
产业真正的跃迁从来不是简单堆算力
而是找到更适合新世界的架构
田晏林
2026-08-10
1 阅读
约9分钟阅读
田, 晏林
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 3B模型碾压英伟达谷歌后,Om AI端侧原生VLX模型:小参数实现物理世界精准感知 田, 晏林 2026-08-10 09:12:33 来源: 量子位 从云计算到云原生,产业真正的跃迁从来不是简单堆算力,而是找到更适合新世界的架构。 田晏林 发自 凹非寺 量子位 | 公众号 QbitAI 具身智能圈,又传来两条重磅消息。 8月6日,Om AI联汇完成 数亿元融资 ,前海母基金领投。 同一天,该公司旗下 全球首款端侧原生模型VLX-Seek 1.5 宣布正式开源。 表面看,这是融资、开源两件事。 资本在下注一种新路线,开发者正在获得一个新入口。 但放在一起看,很难不让人想起20年前亚马逊AWS开启云计算时代的那一刻。 当年,AWS一边全面开放API吸引海量开发者接入,一边获得资本投入验证路线价值。 最终,云计算没有成为简单的服务器租赁生意,而是演变成一套新的基础设施范式。 如今的物理AI,也在寻找自己的 「原生时刻」 。 Om AI联汇定义了一种怎样的范式?在物理AI的全局坐标轴中,它处于什么位置? 全球物理AI,图谱更新 过去几年,AI行业的竞争经常围绕更大的模型、更多的数据、更强的云端算力展开。 从大语言模型到多模态模型,参数规模一度成为衡量能力的重要指标。 但当AI走向真实世界,机器人面对的不是一张张静态图片,也不是一次次文本问答。 它需要在工厂、仓库、家庭、户外等复杂环境中持续运行。 这时,竞争规则也发生了变化。 决定模型价值的不再只是参数量,而是几个更加现实的问题: 响应延迟够不够低?端侧算力能不能承受?部署成本能不能规模化?设备能不能脱离云端独立运行? 因为在物理世界里,每增加一台机器人、无人机或智能终端,都意味着真实的硬件成本、能源成本和维护成本。 如果我们把今天全球物理AI模型的路线放在一张地图上会发现,围绕 「如何让AI理解并行动于物理世界」 这一大命题,全球玩家正在形成几条不同方向。 NVIDIA Cosmos 选择的是 「云端世界模型」路线 。 它的核心目标,是帮助AI理解物理环境,通过世界模型能力构建更加丰富的空间认知基础。 Physical Intelligence的π系列 ,则探索 「云端通用机器人策略模型」 ,希望通过大规模训练让机器人具备跨任务泛化能力。 Google Gemini Robotics 则沿着 「云端VLA」 方向推进,将语言理解、视觉感知和机器人动作连接起来,让机器人能够根据自然语言完成任务。 而另辟蹊径的 Tesla Optimus ,更强调 模型与机器人本体之间的闭环 ,通过自有硬件平台推动机器人能力迭代。 这些路线并没有谁绝对领先。 它们分别回答了不同问题:如何让AI理解世界?如何让机器人获得通用能力?如何让模型与硬件协同? 但在这张图谱里,有一个关键坐标此前并未有过专门的回答,那就是: 如何让一个AI模型从诞生开始,就适应端侧环境? 这是Om AI联汇想填补的位置。 其自研的 VLX端侧流式多模态模型 系列强调「端侧原生」路线,它不依赖云端大算力,也不绑定单一硬件平台。 模型也并非先在云端训练完成,再被压缩部署到设备。 而是在模型设计阶段,就把端侧算力、延迟、功耗和部署成本作为约束条件。 这两者看似只是部署方式的不同,本质上却是两种不同的技术哲学。 前者是在问:如何让一个强大的AI模型跑到设备上? 后者是在问: 如果AI生来就在设备上,它应该长成什么样? 这也是「端侧部署」和「端侧原生」最大的区别。 毕竟机器人真正进入千家万户、进入大量工业场景,不可能永远依赖远端的云端大脑。 当前,在全球物理AI模型竞争版图中,端侧原生正在成为一个新的关键方向。 而Om AI联汇最先看到图谱上的缺口,用VLX补上了。 拆解“端侧原生第一家” 对于「端侧」的探索,不少AI模型很早就展开了。 大家都清楚,云端大模型虽然强大,但也有天然限制。 机器人如果每一次感知都需要上传云端,再等待结果返回,就像让一个人在运动时,每个动作都要先打电话询问远方的大脑。 网络延迟存在,数据传输成本存在,隐私问题也存在。 但工厂里的机器人,需要全天候工作;巡检无人机,需要在没有稳定网络环境的地方执行任务;家庭机器人,需要保护用户隐私。 这些场景决定了, 物理AI不能永远依赖云端大脑。 业内之前的解决方案通常是:先训练一个大模型,再通过压缩、蒸馏、量化等方式,让它适配端侧。 这种「迁移式部署」的方式,模型本身仍离不开云端, 只是努力让自己「变得更轻」。 Om AI联汇想彻底打破限制。 VLX从模型架构层就开始考虑端侧环境,把延迟、功耗、算力、部署成本作为设计前提,而非优化目标。 也就是说,模型不是一个被迫「减肥」的大模型,而是一个天生适合端侧环境的AI。 这个区别决定了物理AI能不能大规模、快速地走出实验室。 端侧原生带来的价值是直接的:更快响应、更低成本、更强自主性,以及让物理AI进入工厂、家庭、无人机巡检、智能终端。 而这种大规模落地要求模型具备本地理解能力、持续交互能力和低成本部署能力。 这也是为什么 端侧原生并非一个营销概念。 它实际上代表了一条新的架构路线,决定着未来物理AI如何进入千千万万个真实设备。 不过,路线判断最终需要技术验证。 一个面向端侧设计的模型,是否真的能挑战更大的模型? VLX-Seek 1.5:我能! 3B模型碾压英伟达、谷歌 VLX-Seek 1.5有3B、10B两个版本,参数规模都不大。 如果说端侧原生架构是其战略选择,那么 流式多模态 就是其以小搏大的战术优势。 传统VLM的工作流是这样的:摄像头拍一张照片,上传到云端,等待模型推理,返回结果。 这是典型的 批处理模式 ,英伟达、Google等巨头的路线本质上都是这个逻辑。 由此带来的问题则是 延迟高、带宽依赖大、隐私不可控 。并且,它把物理世界的连续感知切割成了一帧帧的静态快照。 VLX-Seek 1.5的流式多模态架构完全不同。 它接收的是视频流持续输入,在端侧实时理解,动态输出决策。三层心智链路构成了完整闭环: Flow=持续注意力,让模型从看不见到看得清; Seek=精细推理,让模型从看不准到看得准; Go=执行控制,让模型从动不了到自主行动。 从「拍照识别」到「视频流理解」的范式变化,反向验证了同参数级别能赢巨头的关键, 不在参数,而在架构。 在VLX-Seek 1.5公开的评测中,Om AI联汇测试了3B和10B两个版本,覆盖通用目标检测、指代表达理解、无人机视角感知、具身空间推理以及目标幻觉等多个方向。 同场比较的模型,不仅包括自家上一版的VLX-Seek,还有英伟达的LocateAnything等检测增强型VLM,以及多个更大的开源或闭源模型。 结果显示,VLX-Seek 1.5不仅提升了细粒度视觉理解能力,同时在无人机定位、具身设备空间推理等场景中展现出竞争力。 其中,最具代表性的,是3B参数版本与同规模模型(LocateAnything-3B)的比
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱