医疗健康
morning
张一鸣的「慢」,和整个行业的「快」
摘要
文 | 新眸,作者 | 桑明强 不久前,字节跳动创始人张一鸣与Seed负责人吴永辉共同召开了一场Seed全员会,除了给团队打气,会上他还谈到了对模型蒸馏的看法:不要把蒸馏当作提升模型能力的捷径,哪怕这意味着可能会落后于国内同行。 很多人只看到了不走捷径的字节,反而忽略了它背后的战略定力。 举个例子,SP时代比短信订阅数,团购时代比覆盖城市数,O2O比地推铁军,短视频比日活。每一次大家都在比那个最容...
结论永远是
国产又赢了
桑明强
不久前
字节跳动创始人张一鸣与Seed负责人吴永辉共同召开了一场Seed全员会
除了给团队打气
会上他还谈到了对模型蒸馏的看法
不要把蒸馏当作提升模型能力的捷径
哪怕这意味着可能会落后于国内同行
很多人只看到了不走捷径的字节
2026-08-12
1 阅读
约10分钟阅读
新眸
字号:
文 | 新眸,作者 | 桑明强 不久前,字节跳动创始人张一鸣与Seed负责人吴永辉共同召开了一场Seed全员会,除了给团队打气,会上他还谈到了对模型蒸馏的看法:不要把蒸馏当作提升模型能力的捷径,哪怕这意味着可能会落后于国内同行。 很多人只看到了不走捷径的字节,反而忽略了它背后的战略定力。 举个例子,SP时代比短信订阅数,团购时代比覆盖城市数,O2O比地推铁军,短视频比日活。每一次大家都在比那个最容易量化、最容易写进PR稿、最容易让投资人兴奋的数字。每一次都有人在那个数字上跑到第一,然后呢? 历史的经验告诉我们,真正活下来的,从来不是数字最好看的那个。 今天的AI行业,正在把这场数字游戏玩到极致。 比参数,从百亿到万亿;比榜单,MMLU、GSM8K、HumanEval、Arena Elo一个接一个;比单项能力,谁的视频生成手指更正常,谁的代码通过率高几个点,谁的多模态又在某个benchmark刷新纪录。KOL加班做对比视频,结论永远是"国产又赢了"。朋友圈一片欢腾,仿佛AGI下周就来。 可你把目光从这些数字上移开,去问真在生产环境用AI的人,得到的多半是另一种答案。 模型在榜单上无所不能,到了具体工作里,更像个聪明但不靠谱的实习生,什么都能聊两句,真交给他一件完整的事,你还得在后面收拾烂摊子。 这就是我们今天面对的局面:参数越来越大,榜单越来越好看,热闹越来越多,可AI和真实世界之间那道沟,非但没填上,反而越变越宽。 榜单上的胜利与现实中的困境 今年7月,月之暗面发布Kimi K3,参数精确到2.78万亿,全球最大开源模型。那天我的朋友圈被刷了屏。结果三天后的晚上,月之暗面发公告,说"用户请求量大幅超出预估,逼近现有集群承载极限",即日起暂停C端新用户订阅。 这件事本身就能说明一些问题。花这么多钱,烧这么多卡,训练出参数上碾压同行的模型,结果连最基本的用户访问都扛不住。这就像车厂造出台发动机参数全球第一的跑车,一开出来发现油箱只能装十公里的油。 另外,榜单本身的可信度也越来越可疑。今年八月,两家机构发布同月份国内AI应用月活数据,同一个豆包,一家5.28亿,另一家3.82亿,差了1.46亿。没有谁造假,只是月活这个用了二十年的指标,到了AI产品这儿突然测不准了。插件调用算不算?API访问算不算?连统计口径都没有共识,那些煞有介事的排名,看看就好。 视频生成领域的榜单竞赛,已经到了走火入魔的地步。可灵、即梦、Vidu这些,每过一端时间就有一家宣布在某个评测集登顶,KOL迅速跟进出"深度评测",结论永远是"国产又赢了"。 可你去问真正用这些工具做内容的人,他们关心的根本不是谁在benchmark上高零点几分。他们关心生成一条视频要等多久,改十次能不能有一次能用,复杂场景人物会不会崩,商用版权有没有保障。 这些问题,没有一个榜单能回答。 我想起2011年的千团大战。全国五千多家团购网站,开发布会都在说用户数、覆盖城市、单日交易额,数字一个比一个吓人。王兴那时候就讲,团购的核心不是铺多少城市,是每个城市能不能把单位经济模型跑正。没人听。大家都烧钱抢市场,烧到最后,活下来的是美团。 今天AI行业的逻辑很类似。 大家都在拼那些容易量化、容易传播、容易写进PR稿的数字,很少有人愿意碰真正难的事:怎么让模型在工业现场稳定工作,怎么让AI在零容错的金融医疗场景给出可解释、可审计的结论,怎么把推理成本降到企业愿意大规模买单的程度。 这些事不性感,上不了热搜,也没法在发布会上用一张PPT展示,但它们才是AI真正进入生产体系的门槛。 苹果就是最好的例子。2024年WWDC上Apple Intelligence被吹得天花乱坠,结果跳票两年,今年WWDC才拿出像样的版本,核心能力还得靠接OpenAI和谷歌的API。发布会当天,苹果股价从盘中317美元跌到收盘301美元,市值蒸发2300亿美元。华尔街逻辑很简单:你演示的这些,ChatGPT两年前就有了,我们等了两年,就等来了这个? 这就是参数繁荣掩盖下的真相:我们在实验室里、在评测集上、在精心准备的demo里取得的所有胜利,到了真实世界都要重新打一遍折,而且这个折扣,经常大到让你怀疑人生。 抄作业抄不出第一名 张一鸣为什么对蒸馏这么敏感? 技术上的蒸馏本来是正经方向,用大模型输出训练小模型,让小模型在特定场景接近大模型能力,同时降低推理成本。但在今天的国内AI圈,蒸馏已经异化成了一条抄近路的产业链。 坦白地说,新模型发布流程现在高度标准化。国外发布或者更新一个新模型,最多几周时间,国内就有一堆模型宣布"在各项基准上追平甚至超越"。怎么做到的?说白了很简单:拿新模型的输出当训练数据,蒸馏到自己的模型里,再针对benchmark做专门优化。 OpenRouter有个数据很说明问题。今年1月,开源模型处理的token占比是34%,到了6月变成65%。半年翻了近一倍。开源模型突飞猛进的背后,有多少是真正的技术突破,有多少是蒸馏和benchmark过拟合带来的虚假繁荣?关于这个问题,很多人自己心里都有数。 今年7月,前OpenAI研究员Diogo Almeida发了篇博客,说当年那篇奠定Scaling Law的论文,从根上就有个bug,计算推理最优分配时算错了,导致整个行业过去五年都在训练"参数过大、训练不足"的模型。DeepMind的Sander Dieleman第一时间转发,说这个bug大概率让行业在错误方向浪费了巨额算力。 这件事最耐人寻味的是,这么多聪明人,这么多顶级公司,几年时间,上万张GPU烧进去,居然没人发现这个基础错误。为什么? 因为所有人都在同一条赛道上狂奔,没人停下来问问路对不对。大家都在堆参数,你不堆你就落后;大家都在刷榜单,你不刷你就融不到钱。路径依赖一旦形成,连质疑的声音都会被淹没。 蒸馏就是这条路径依赖的终极形态。 可问题是,抄作业永远抄不出第一名。如张一鸣所讲,你蒸馏Claude,最多无限接近它。更要命的是,这种路径依赖会从根上废掉一个团队的研究能力。当你的工程师习惯了用别人的输出训练模型,他们就再也不会去想,怎么从第一性原理出发改进模型结构,怎么构建真正高质量的数据集,怎么解决那些根本性的技术难题。 这才是张一鸣真正担心的。他看到的不是一时的榜单高低,是整个团队的创新文化会不会被捷径腐蚀。 Builder.ai破产就是很典型的例子。这家估值15亿美元的英国公司,拿了微软和卡塔尔投资局4.5亿美元,对外宣传AI可以自动写代码,客户想要什么软件几分钟就能生成。今年五月破产清算时大家才发现,所谓AI自动生成,后台是七百多个印度程序员在一行行手写代码。最讽刺的是,这家公司还上过福布斯"改变世界的50家AI公司"榜单。 这样的故事不是个例。从Humane AI Pin到Rabbit R1,过去两年倒下的AI公司已经数不清。有机构统计,2024到2026年入场的AI公司,40%已经关停,原因惊人地一致:没有核心技术,没有数据壁垒,没有真正的场景,大模型一旦更新了同样的功能,它们的存在价值立刻归零。 历史不会重复,但总是押着同样的韵脚。今天AI行业的参数竞赛、榜单崇拜、蒸馏捷径,和当年的手机参数大战、新能源PPT造车,本质上是同一件事:用容易量化的数字,回避真
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱