首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

张一鸣以退为进

摘要

文 | 强调Next 8 月 6 日,字节跳动 CEO 梁汝波在公司全员会上承认,Seed 的大语言模型与海外领先模型之间的差距正在扩大。他要求团队接受一段时间的落后,坚持自研和长期优化。张一鸣则在更早的内部会议上明确反对蒸馏竞争对手模型。 同一天,《晚点 LatePost》披露,字节正在讨论训练一个参数规模超过 5 万亿的大模型。作为参照,报道所列的阿里 Qwen 3.8-Max 和月之暗面 K...

Seed Coding Kimi token 市场反响有限 Anthropic Opus ARR 400 豆包大模型的
2026-08-07 1 阅读 约10分钟阅读 强调Next
分享:
字号:
文 | 强调Next 8 月 6 日,字节跳动 CEO 梁汝波在公司全员会上承认,Seed 的大语言模型与海外领先模型之间的差距正在扩大。他要求团队接受一段时间的落后,坚持自研和长期优化。张一鸣则在更早的内部会议上明确反对蒸馏竞争对手模型。 同一天,《晚点 LatePost》披露,字节正在讨论训练一个参数规模超过 5 万亿的大模型。作为参照,报道所列的阿里 Qwen 3.8-Max 和月之暗面 Kimi K3,参数规模分别为 2.4 万亿和 2.8 万亿。该计划仍处于早期讨论阶段,最终未必发布。 这是两个看似矛盾的信号,但实际上前者重新设定了追赶时间,后者决定了追赶方法: 字节不准备借助竞争对手模型的输出来迅速补齐榜单,而是试图把算力、数据和组织资源集中到一次更大规模的预训练上。 这是一条成本更高、结果也更难预测的路线,参数规模只说明投入方向,不等于最终出来的模型能力。 字节真正要验证的是能否把资源优势变成独立产生前沿能力的训练体系和组织能力。 “跳到同行数倍”的押注 据报道,超 5 万亿参数模型将由 Seed Foundation 负责人项亮主导,与大语言模型预训练数据负责人沈科合作。两人均出身于字节的搜索、广告和推荐体系。为此,Seed 正在重新划分职责和分配资源。 推动这项计划的直接原因,是 Seed 上半年的表现没有达到内部预期。2 月中旬发布的 Seed 2.0 市场反响有限,而GLM-5、Kimi K3 等国内模型则在编程、工具调用和复杂任务上取得显著进展。 字节与其寄希望于在追赶中赢球,不如换一张更大的赌桌。 赌注首先体现在工程复杂度上。对采用混合专家架构的模型而言,总参数量、单次激活参数量、训练计算量和推理成本是不同指标。5 万亿参数可以扩大模型容量,却不能自动解决数据质量、训练稳定性和能力涌现的问题。 参数规模如果不能与架构、数据和训练方法同时升级,最后可能只得到一个更昂贵的模型。 因此,5 万亿更像字节对资源配置方式的表态,而不是一张提前兑现的技术支票。项亮和沈科的“搜广推”背景也说明,这项任务不只是算法研究,还包含大规模训练系统、数据工程和跨团队协同。 模型越大,任何一个环节的低效都会被放大。 落后已经开始影响收入 字节急于翻盘的另一层原因,在账本上。 先看技术面的差距。今年 2 月中旬,吴永辉执掌 Seed 后推出的关键模型 Seed 2.0 正式发布,市场反响有限。几乎同一时间,智谱开源的 GLM-5 被市场视为国内第一个能与 Anthropic Opus 系列比肩的模型。7 月发布的 Kimi K3,多项第三方评测认为已接近海外闭源旗舰。 差距最疼的地方在 Coding。春节期间,Anthropic 凭借 Opus 系列的编程能力迅速打开程序员和 B 端市场,据公开报道,其 ARR 很快逼近并反超 OpenAI。智谱和月之暗面则凭借持续提升的 Coding 能力,ARR 分别突破 10 亿美元和 3 亿美元。中国大厂这才意识到,自己错过了 Coding 的窗口期。 再看字节的收入结构。火山引擎目前是国内最大的模型 API 卖家,市场份额约占一半,2025 年收入约 150 亿元,今年内部目标超过 400 亿元。但据晚点报道,豆包大模型的 token 消耗中, 超过一半来自 Seedance 和 Seedream 两个多模态生成模型,语言模型占比不高。 随着短剧行业增长见顶,Seedance 的 token 消耗和收入增速放缓,豆包大模型的 token 消耗,3 月为 120 万亿,6 月为 180 万亿,低于原计划 250 万亿至 300 万亿的目标。 简言之,字节的 AI 收入偏科了。多模态生成赚的是内容消费的钱,需求跟着短剧、电商素材这些行业周期走。语言模型尤其是 Coding,赚的是生产力的钱,客户是开发者和企业,粘性和客单价都高得多。 400 亿的收入目标,靠视频生成撑不起来,必须补语言模型这块短板。 不蒸馏,把追赶成本留给自己 两周前,张一鸣与 Seed 负责人吴永辉共同参加 Seed 全员会。据媒体报道,张一鸣在会上表示,训练大模型本就困难,团队可以接受一段时间的落后。他认可 Coding 是当前的关键方向,但也提醒团队,编程只是眼下热点之一,不应让全部研究资源被单一场景牵引。 他对蒸馏的态度更明确:不依赖竞争对手模型的输出来提升 Seed。 这里需要区分两种做法。蒸馏和合成数据本身是成熟的模型训练技术,头部实验室普遍会用自家模型生成数据、训练后续版本。字节反对的,是把 Claude 等闭源模型或 Kimi K3 等开放权重模型作为“教师”,批量获得输出,再用这些数据补齐自身的推理、编程和工具调用能力。 这一原则也并非临时形成。字节早在 2023 年 4 月便要求,不得将 GPT 生成的数据加入自家模型训练集,并通过 API 调用检查和输出相似度抽样,排查违规使用。此后,Seed 内部多次讨论是否借助外部模型蒸馏,最终均被否决。 拒绝蒸馏竞争对手,意味着字节放弃了一条见效更快的追赶路径。讨论 5 万亿参数,则意味着它愿意用更多算力、数据和时间承担这部分成本。两个决策其实是同一个目标: 不在别人的能力曲线上逼近,而是要跳到下一个能力平台上去等对手。 这套打法,字节在视频模型上跑通过一次。2025 年,视频生成领域的主流判断是:沿 DiT 架构继续扩大预训练,提升空间已经不大,多数团队把重心转向后训练。快手可灵也曾尝试训练更大的模型,但中途退了回去。Seedance 反着来:把预训练做到极致,做出第一个完整采用 MoE 架构的视频生成模型,参数 2000 亿,2026 年 2 月上线后被公认为全球性能最强的视频模型,随后成为火山引擎 MaaS 业务的营收基本盘。 但这个案例不能直接证明 5 万亿语言模型也会成功。Seedance 当时押注的是一个共识退潮的方向,竞争者减少,核心算法团队也只有十余人。扩大语言模型则是 OpenAI、Anthropic、xAI 和中国头部实验室都在推进的路线。字节没有明显的信息差,只能赌自己的资源差能否转化为训练效率和模型能力。 大力出奇迹 2.0:从赛马到重注 为了打这一仗,字节正在改掉自己最出名的组织打法。 字节擅长的“大力出奇迹”打法过去依赖赛马:在同一方向安排多个团队并行试错,再根据市场反馈集中资源。字节早期批量推出资讯应用,后来以火山、抖音和西瓜同时进入短视频,都是这一机制的代表。 赛马机制的本质,是用团队数量换成功率,但前提是试错成本低、市场反馈快。 前沿大模型不吃这一套。单次训练成本以亿元计,反馈周期以年计,十个团队做十个方向,等于每个方向都投入不足。 另据媒体报道,字节高层正推动 Seed 取消同一方向上的内部赛马,收拢研发资源,明确团队职责并打破部门墙。为补齐 Coding 能力,张一鸣亲自邀请 DeepSeek 核心研究员郭达雅加入 Seed,负责专项训练。相关研发资源也被统一划归给他。也正是在这个战略下整合了火山引擎、飞书和豆包的相关资源。 这套组织调整解决的是投入分散问题,却不能消除研究不确定性。赛马减少后,单一路线获得的资源更多,方向判断错误的代价也会更大。对字节而言,5 万亿参数模型既是一次技术
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱