首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

纯血国产!4B模型越级打怪,杀入万亿赛道

摘要

新智元报道 就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。 事情是这样的。 9月1日,Hugging Face上线了两个开源端侧模型: 星火X2.5-4B和1.7B 。 本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两 圈的对手,狠狠地秀了一把肌肉。 比如考验多轮工具调用的 τ³-bench ,拿了30.4分。这测...

星火X2 新智元报道 就在最近 一台彻底断网的普通笔记本 靠着一个仅有4B参数的小模型 硬是干完了一件过去只有大模型才兜得住的活 事情是这样的 9月1日 Hugging Face上线了两个开源端侧模型
2026-09-03 1 阅读 约10分钟阅读 新智元
分享:
字号:
新智元报道 就在最近,一台彻底断网的普通笔记本,靠着一个仅有4B参数的小模型,硬是干完了一件过去只有大模型才兜得住的活。 事情是这样的。 9月1日,Hugging Face上线了两个开源端侧模型: 星火X2.5-4B和1.7B 。 本以为只能干干文本补全的轻活,结果一上榜单,4B模型硬是当着一众大一两 圈的对手,狠狠地秀了一把肌肉。 比如考验多轮工具调用的 τ³-bench ,拿了30.4分。这测的是极限定力,几十步操作连轴转,中间只要错一步,整个任务直接拉胯。 测试MCP协议的 MCP-Atlas ,拿下54.6分。把它丢进真实的API环境里,它给接口填的参数严丝合缝,一点报错的空子都不钻。 自主上网搜信息的 BrowseComp ,跑到40.9分。哪怕网页里一堆弹窗和垃圾代码,它照样能像活人一样,把有效数据生抠出来。 至于专考「听人话」的 IFBench ,更是飙到了75.0分。面对那种字数超长、格式层层叠加的变态指令,它硬是做到了一丝不差。 在考察智能体(Agent)、工具调用和真实任务完成率这几项硬指标上,更是实现了「越级打怪」。 1.7B版本也不含糊。在考察MCP工具使用的MCP-Atlas里,它拿了23.4分,同尺寸这一档里最高。 光看数字没意思,我们第一时间把它下下来跑了跑。 装进本地环境后,直接下指令:写一个霓虹烟花的HTML页面。代码出得极其利落,一口气吐完,中间不带卡壳的。 跑出来的效果确实惊艳。 鼠标点哪儿哪儿炸,一簇七十多颗粒子四散开来,同一朵烟花颜色高度统一,粉的、青的、橘的随机切换——烟花的物理动态和氛围感,一下就出来了。 值得一提的是,这两款模型从头到尾都基于 全国产算力平台 完成训练,部署端更是打通了英伟达、华为、海光及后摩等主流硬件平台。 做这件事的,是科大讯飞全资子公司「词元星火」。 端侧AI 跨越「好用」门槛 过去这两年,大模型的故事几乎全发生在云端。参数越堆越庞大,离真实用户却越来越远。想用?必须先联网,还得把数据乖乖交出去。 可现实中偏偏有一大批机器「碰不到云」。比如内网里的办公电脑、工厂车间里的终端设备。 这些无网场景当然也有人试过水,办法无非两种。 要么,硬往本地塞几十、上百B的开源大模型,结果对硬件要求极高,部署折腾半天,跑起来还像看幻灯片; 要么,退而求其次用个小尺寸模型。 可过去的小模型,能力大多停留在「陪聊」和「文字续写」。你把一叠报表扔给它说「帮我整理一下」,它大概率会一本正经地给你回复一段「整理建议」。 端侧模型的尴尬一直卡在这儿。 它只会动嘴,动不了手。 而用户的诉求其实特别朴素: 几十页的操作手册能不能一次性读完?一个需要多步操作的复杂任务能不能直接帮我干完? 星火X2.5这两个模型,冲的就是这件事。 要干脏活累活,第一步是得先「挤得进」那台机器。 在BF16精度下,4B模型的权重只占8个多G,1.7B模型只要3个多G。如果做一下4bit量化,体积还能再砍一半。 尺寸压到这份上,它的使用场景就非常清晰了。 把 4B 模型 直接 放 进笔记本和工作站, 哪怕是塞进一套正在运行的老旧业务系统里也毫无压力; 1.7B 模型 则专攻汽车座舱、智能家居等, 一台普通手机就能轻松带飞。 实测 断网生啃两份八千字合同 为了探探它的底,我们把它接进Codex,丢给它两份八千多字的商业合同,要求它找出所有的改动痕迹。 从结果来看,它找出的其中三处暗雷,说实话,连我们自己用肉眼看都未必能挑得出来。 「应当」被改成了「可以」。 就这两个字的差别,强制义务瞬间变成了任意条款。人类审阅时,眼睛一扫极容易滑过去。 「知识产权」条款整段消失。 B版合同里关于衍生成果归属的那段根本不存在,它是顺着条款编号递进的逻辑硬揪出来的。找一个「不存在」的东西,远比找一个「被修改」的东西要难得多。 违约金条款,它竟然 连 着看了。 乙方违约金从万分之五降到了万分之三,甲方却没动,两条原本对等的条款现在不对等了。这种相隔好几行的内容,必须具备全局记忆力才能比对得出来。 除此之外,它还严谨地逐条列出了A版原文、B版原文、对我方的影响以及风险等级,最后按高、中、低风险分档汇总,并附上了五条应对建议。这套东西拿到手,基本上可以直接转发给法务,连返工都省了。 审完文本合同,紧接着是更硬核的数据处理。 我们丢给它一张未经处理的原始表格。结果它自己写了段Python代码,自己跑通,自己生成了分析报告。 从理解需求、写脚本、执行到检查结果,全程零插手。它不是在给你提供「建议」,而是真刀真枪地自己动手,把文件盘了出来。 抓异常的眼光,更是极其毒辣。 单笔超5000审批上限的4条、字段缺失的3条、有拆单嫌疑的11条,被它揪得一清二楚。 连带周末报销、负数金额、小数位异常、工号姓名不匹配、甚至日期格式混乱这种恶心人的暗病,全被它挨个高亮标出。 最关键的是,交付的报告格式严丝合缝,打开就能直接用,彻底免去了人工二次排版的折磨。 对于财务、审计、法务这些天天跟敏感数据死磕的岗位来说,这才是决定AI到底「能不能用」的绝对分水岭。 而且别忘了,这一切全部是在一台断网的笔记本上完成的,合同数据连一个字节都没有离开过这台机器。 它究竟是怎么做到的? 为了让端侧小身板爆发出这种越级的智能体能力,词元星火在底层和后训练阶段,砸出了两套绝活。 第一招:混合注意力机制,把显存抠到极致。 要干复杂的活,首先得「看得全」。 星火X2.5不仅原生支持最长100万Token的上下文,还在底层架构上动了刀,极其聪明地把注意力层一分为二。 一层负责通读全文建立宏观联系,另一层则死抠眼前的局部细节。 这样既能看得足够远,又不需要在每一层都把算力拉满。 而省下来的,全是端侧最宝贵的显存。同样跑满100万Token,它占用的显存只有传统全局注意力模型的四分之一。 端侧模型记性差、长文本前言不搭后语的老毛病,就这么被治好了。 第二招:多教师在线策略蒸馏(MOPD),不教答案只教「走法」。 看全了之后,还得「会干活」。 为了把复杂的动作逻辑塞进4B的参数里,研发团队打出了一套叫MOPD的组合拳。 首先,用高质量数据打底,再按编程、推理、工具调用分科开小灶,练出一批在垂直领域登峰造极的「单科专家」大模型。 接下来就是核心环节——用这些老师傅去带徒弟。 传统蒸馏往往是老师给出标准答案,小模型照着死记硬背。但小身板的脑容量摆在这,硬知识装不下就是装不下。 而MOPD玩的,是更硬核的「在线策略」。 简单来说就是,小模型先自己上手去盘这道题,老师傅则在旁边全程督战,一步步纠正路线。读需求、挑工具、填参数、查报错,失败了换条路再来。 相比于硬塞知识的老路,它能把「遇到问题怎么解」这套动作机制,直接传给小模型。 千万台国产设备 在等一个能跑的模型 跑分和性能只是第一关。 真正决定 AI 能不能大规模 落地 的,是它能不能顺畅地活在真实的行业设备里。 按照国资委79号文给出的时间表,到2027年底前后,央企国企必须完成信息化系统的信创替代——芯片、操作系统、中间件、基础软件,要求100%替换。 这背后是一个巨大的市场。 据券商测算,政企信创的市场空间动辄在数千亿乃至万亿级别。单单是党政口径,2025到2027年间的PC替换需求就在 千万台量级 。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱