首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢

摘要

AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 梦瑶 2026-09-18 20:22:47 来源: 量子位 梦瑶 发自 凹非寺量子位 | 公众号 QbitAI 这两年,AI赛道越来越热。 大语言模型LLM(Large Language Model)在卷得飞起的同时—— 另一条结构化数据侧的AI路线LDM,也突然开始涌进各类型头部玩家。 LDM (Large Data Model...

Large Model LimiX AGI新战场谷歌亚马逊巨头激战 杀出个中国LimiX 2赢了又赢 2026 量子位 凹非寺量子位 公众号
2026-09-18 1 阅读 约9分钟阅读 梦瑶
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> AGI新战场谷歌亚马逊巨头激战,杀出个中国LimiX-2赢了又赢 梦瑶 2026-09-18 20:22:47 来源: 量子位 梦瑶 发自 凹非寺量子位 | 公众号 QbitAI 这两年,AI赛道越来越热。 大语言模型LLM(Large Language Model)在卷得飞起的同时—— 另一条结构化数据侧的AI路线LDM,也突然开始涌进各类型头部玩家。 LDM (Large Data Model),即 结构化数据基础模型 ,其瞄准的是生产侧的核心痛点:即如何让基础模型直接学习不同结构化数据中的变量关系、条件关系和生成机制。 到底有多火呢,这么说吧! 像咱熟悉的美国 Google、Amazon ,德国企业软件巨头SAP等玩家纷纷下场布局~ 不过,谁成想呢,巨头们刚涌进LDM抢位,一支中国团队已经先把榜首坐成了「固定席位」。 9月15日,德国软件巨头SAP抢发TabPFN-3.5,几小时后(9月16日),一支由 清华博士 组成的团队,用一个400M参数的结构化数据基础模型—— 直接拿下了TabArena、TALENT、BCCO三个国际主流基准测试中二分类、多分类、回归等各项任务的 「第一」 ,呈现断层领先: △官方TabArena榜单 不卖关子,这个把谷歌等一众大厂按在地上摩擦的,就是「稳准智能」刚刚发布的: LimiX-2 。 值得一提的是,这也不是稳准智能第一次把LDM做到国际头部了。 去年他们发布的国内首个结构化数据基础模型LimiX已经上演过很长一段时间的霸榜大戏,但此后团队也没有追着榜单追赶,而是继续往底层技术和模型储备里扎。 然后这次,直接给海内外主流选手再来了个措手不及~ 在这家中国团队看来,真正重要的, 从来不是拿下一次第一,而是每到关键节点,都有能力重新回到第一。 而作为国内首个结构化数据通用大模型,LimiX啃下的,正是数据背后最值钱也最难找的「因果规律」。 相比TabPFN这类偏目标预测的行级建模路线,LimiX-2把 面向变量关系建模 前置为核心目标,学习跨变量、跨样本的联合依赖结构。 此外,其还自建了一套高质量 自动化数据合成引擎 ,先让模型见过足够复杂的数据世界,再去处理真实任务。 过去几年,LLM已经吃透了文本、语音、视频,但一碰到工业生产、科学研究等应用侧真正拿来做决策的场景,对因果关系、准确性和稳定性的要求会陡然提高,这也让LDM的价值开始越来越清晰。 当前就在这条越来越热的赛道中,稳准智能联合清华已然率先把成果跑进了行业头部位置。 LLM啃不动的数据分析硬骨头,LDM开始接手了 大语言模型,这两年能力边界一路狂飙。 但热闹归热闹,随着AI真正往产业深处走,一个此前很容易被模型能力增长掩盖的问题,也开始变得越来越清晰—— 那就是现实世界,远比语言世界「更大」。 要知道今天的大语言模型能力,很大程度上建立在一个极其庞大的语义世界之上。 文本、代码、论文、数学公式,甚至经过标注和描述的图像、视频,其中承载的知识都有一个共同特点,那就是它们已经经过了人类的一次理解、筛选和抽象。 LLM做的事情,就是把这些已经进入人类知识体系的信息编码成Token,通过海量语料学习上下文关系,再进一步形成知识、推理和生成能力。 所以从信息论和建模对象来看,LLM所处理的,更多是已经完成「语义化」的现实。 △AI生成 但问题是, 在产业系统里,另一类数据是长期存在于这个语义层「之外」的。 以制造业为例,温度、压力、转速、原料配比、设备状态、能耗等几十、几百甚至上千个变量会同时变化,共同构成一个持续演化的高维数据空间。 其中大量关键规律,可能并没有被人类提前总结成规则、公式或文本知识。 更重要的是,产业真正关心的,往往也不是单个变量是什么,而是变量之间存在什么稳定关系,哪些关系可以跨环境成立,以及一个变量变化之后,系统整体会如何响应。 如果先把这类数据转写成文本,再交给LLM处理,中间天然会经历一次 「信息压缩」 。 但在生产系统中,那些被压缩掉的细粒度差异,恰恰可能直接决定预测精度、良率和风险判断,在语义空间里看似可以忽略的信息,到了生产空间里可能恰恰是最 值钱 的信息。 这恰恰构成了「结构化数据建模」与「语言建模」之间最本质的差异—— 如果说LLM主要学习人类已经表达出来的世界,那么LDM更希望直接进入真实世界留下的高维数据空间,从变量关系本身出发理解规律。 二者面对的是不同的信息空间,也因此更接近两条平行、互补的基础模型路线~ 能往生产深处扎,也能补足LLM对真实数据世界理解不足的那一块儿缺口,确实有前景啊。。。 随着AI越来越多进入复杂决策场景,LDM也正成为基础模型体系中越来越重要的一块能力拼图。 于是乎,这两年,海内外玩家也开始接连入场,结构化数据基础模型的竞争,正在明显《提速》。 今年 Google 直接发布TabFM,把表格数据基础模型正式纳入自己的Foundation Model版图。 Amazon 也推出Mitra,专门探索一个预训练模型如何跨不同表格、不同任务直接迁移。 SAP 动作更猛,先做SAP-RPT-1,今年又直接收购TabPFN背后的Prior Labs,投入超过10亿欧元扩建结构化数据AI研究团队。 就在几天前,最新的 TabPFN-3.5 Plus 又正式进入SAP AI Core,直接开始做现金流预测、付款延迟、供应商风险、客户流失这些企业核心决策任务。 从Google、Amazon一路到SAP,结构化数据基础模型已经从学术圈里的新方向,迅速变成全球科技巨头集体押注的一块基础能力。 重做底层技术范式,LimiX让模型理解数据背后的因果机制 LDM赛道开始升温,崔鹏和团队多年押注的方向,也终于走到聚光灯下。 稳准智能首席科学家、清华大学计算机系 崔鹏 教授,长期研究结构化数据与因果智能,也是LDM理念的提出者之一。 很长一段时间里,这支团队都在啃一些更底层的问题:Scaling规律能否延伸到结构化数据,CMNs能否进一步打开因果建模的能力上限。 这些偏离传统因果研究路径的探索,当时并不轻松。 如今,LimiX、LimiX-2连续冲上国际Benchmark前列,也让这条当初看起来更冒险的技术路线,开始得到模型效果的直接验证。 跟赛道升温相比,一个更值得注意的变化是: 大家底层技术其实并不那么一样。 比如TabPFN为代表的PFN路线,核心目标很明确:给定上下文和目标,让模型快速适应一张新表,并把Y预测准。 这条路线非常适合分类、回归等任务,也推动了Tabular Foundation Model快速发展。 但当结构化数据模型继续往更深处走,一个问题开始冒出来: 如果我们想知道的,已经不止是「Y等于多少」呢? 毕竟生产侧真正关心的,往往还包括变量之间是什么关系,一个变量发生变化之后,其他变量会怎么动。 到了这一步,传统以目标变量为中心的PFN路线,其能力边界就逐渐显出来了—— 对于不少PFN类模型而言,数据通常会先被压缩成更高
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱