首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

国产RSI模型交卷!Flash模型靠它反打旗舰

摘要

国产RSI模型交卷!Flash模型靠它反打旗舰 一水 2026-09-17 11:26:21 来源: 量子位 RSI,彻底火了。 从硅谷一路烧到国内, 「让模型参与训练下一版自己」 几乎一夜之间成了AI圈最热的叙事。 不过热闹归热闹,目前真正拿模型交卷的还屈指可数。 而就在这一当口,「港股AGI第一股」云知声正式发布U2-Flash,率先交出一份国产RSI早期答卷 。 △图源:云知声 在U2-Fl...

百万Tokens Flash 国产RSI模型交卷 Flash模型靠它反打旗舰 2026 量子位 RSI 彻底火了 从硅谷一路烧到国内 让模型参与训练下一版自己
2026-09-17 1 阅读 约9分钟阅读 一水
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> 国产RSI模型交卷!Flash模型靠它反打旗舰 一水 2026-09-17 11:26:21 来源: 量子位 RSI,彻底火了。 从硅谷一路烧到国内, 「让模型参与训练下一版自己」 几乎一夜之间成了AI圈最热的叙事。 不过热闹归热闹,目前真正拿模型交卷的还屈指可数。 而就在这一当口,「港股AGI第一股」云知声正式发布U2-Flash,率先交出一份国产RSI早期答卷 。 △图源:云知声 在U2-Flash的后训练闭环里,模型已经开始深度参与自身演进: 从生成训练数据、分析执行轨迹,到巡检和修复训练系统 。 然后,反常识的部分来了。 按行业惯例,Flash一般默认是「旗舰平替」,通常更快、更便宜,但能力相对打折。 结果U2-Flash呢? 速度和省钱能力的提升确实没含糊。相比U2,其生成速度提升2.1倍,Agent任务完成时间缩短35%,任务迭代步数和Token消耗也降低了20%至30%。 但能力不仅没打折,反而把上一代U2甩在了身后 : DeepSWE v1.1从上一代U2的32分冲到64.6分,直接翻倍; TerminalBench 3.0从2.7分飙到24.3分,达到9倍; SWE-Bench Pro拿下61.6分,较前代提升10.5分。 而比成绩反超更值得关注的,是U2-Flash展现出的智能密度。 它采用稀疏MoE架构,总参数约266B,单次推理只激活约10B, 不到总参数的4%,却在代码、Agent等任务上,交出了足以和主力模型正面掰手腕的成绩,部分表现甚至闯进万亿参数级模型所在的区间 。 好家伙,这相当于把Flash的「不可能三角」直接掀了: 更快、更省,能力还跨了一代。 不说了,实测火速走起。 把Flash当干活主力,答案这次是:yes! 打开云知声MaaS平台,U2-Flash已经摆在首页,平台支持在线体验以及申请API调用。 重点看了下API,它同时兼容OpenAI和Anthropic两套主流协议,Claude Code、Trae、Cursor、Cline这些常用工具官方给了接入方式,剩下的Harness只要支持自定义模型,换下Base URL、API Key和模型ID就能接。 也不多折腾了,我直接选了手边的WorkBuddy,不到一分钟就显示调用成功。 顺带一提,U2-Flash还提供none、low、high和max四档思考强度,可以按任务难度在速度和推理深度之间切换,不过WorkBuddy这次没有开放手动切档,我也就没有强行横评。 刚准备给模型充点钱,结果一看后台,惊喜来了: U2-Flash当前限时六折 。 输入价格0.6元/百万Tokens、输出价格1.2元/百万Tokens、缓存命中价格0.12元/百万Tokens。 熟悉国内主流模型API价格的我知道,U2-Flash基本可以归属「便宜」这一档。 还没等我小氪一把,结果后台突然又跳出来一个活动页,嗯?? 9月15日至9月30日,人人都能免费领取1亿Tokens使用额度。 1亿Tokens,按一次代码仓库分析或长文档任务消耗几十万到百万Tokens计算,也够连续跑上数十到上百次。 那还等什么。 我直接拉了一个表格对比了一下U2和U2-Flash,然后挑出了三个需要重点测试的地方。 1、U2-Flash能不能把活干得又快又好? 2、遇到意外时,它能不能自己救场? 3、512K上下文到底是生产力,还是只是一串漂亮的数字? △图片由AI生成 不过正式上强度前,先拿一项看起来有点「越界」的能力热个身。 U2-Flash虽然只支持文本输入输出,但接入Harness和外部工具后,照样能交付PPT,甚至搭建3D场景 。 所以,我先让它做一份RSI科普PPT试试水。 视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ PPT提示词是AI顺手帮我写的,我只给了一个大致方向,U2-Flash便自动搜集公开资料、梳理内容结构,再一路完成设计与交付。 老实说,效果有点超出我的预期,也让我更期待接下来的挑战了。 Case 1:不给Issue,自己找Bug 第一关,考主动发现问题。 为了排除模型见过答案的可能,我专门虚构了一个全新的ExpenseFlow报销统计项目。 仓库不大,现有测试也全部通过,表面看起来一片祥和。 然后,我悄悄在项目的统计和日期处理链路里,故意埋了三个坑: 一笔已经被驳回的报销,居然还能偷偷混进已报销总额; 一笔北京时间8月1日凌晨提交的记录,存成UTC时间后又被系统塞回了7月; 到了CSV导出环节,日期还会跟着一起串月。 没透露任何线索给U2-Flash,我火速扔下一句话: 请独立完成发布前验收,自己找问题、改代码、补测试,最后交付完整结果。 视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ 结果,它只用了 7分6秒 就准确揪出了全部问题,还附赠了一份内容详尽的验收报告。 (P.S. 测试前我提前准备了一个验收脚本,跑了一遍证明确实找对了) Case 2:撞墙之后,能不能自己回来 第二关,我故意把环境弄乱,看它会不会被错误线索带跑偏。 这次的ProfileSync 2.0,是个同步用户资料的项目。 代码本该从新版API读取用户姓名,实际同步结果却是一片空白。 更麻烦的是,项目里的资料还互相打架: README给了错误的启动命令,旧文档写着过期字段,历史日志又把问题甩给了网络 。 U2-Flash得自己判断哪份资料可信,再找到真正的故障。 我给它的提示依然很简单: 请独立完成ProfileSync 2.0发布前验收,自行确认运行方式和接口契约,发现问题后完成修复、补充测试,并交付完整结果。 开局没多久,第一堵墙来了。 README让它「运行python app.py」,但项目里根本没有这个文件。 不过U2-Flash没有在错误指令上打转。 仅用时3分32秒 ,它便锁定真正故障、完成修复,还把测试从1项补到7项,最终全部通过。 视频地址:https://mp.weixin.qq.com/s/JH9JICzAqfYz0xyfbCeaOQ Case 3:14份文件一股脑塞进去,能不能直接交稿 最后一关,轮到512K长上下文。 这次我模拟了一场真实的产品发布,把整套项目资料全部扔给U2-Flash: 14份文件、四种格式,几乎铺满一桌 。 里面既有Brief、采访和产品白皮书,也有Release Notes、数据表、客户案例、会议纪要、合规说明和行业报告。 核心信息散落在不同文件里,还混着大量无关内容。 换成人工处理,光是挨个打开、筛选重点,就得忙活半天。 我直接让U2-Flash读完全部材料,交付一份完整DOCX: 包含1200至1500字发布稿、核心事实来源表、材料冲突清单,以及五个发布前待确认问题。 最终,U2-Flash用时 8分36秒 ,成功完成任务。 对照原始材料, 我特
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱