首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
汽车 morning

Gemini 3.8 Flash上线:性能接近Opus 5,价格不变但任务更贵

2026-09-03 1 阅读 约10分钟阅读 字母AI
分享:
字号:
文 | 字母AI Gemini 3.8 Flash,来得比想象中还快。 8月13日,Gemini 3.7 Flash刚刚上线;9月2日,Gemini 3.8 Flash已经接棒。过去6周,Google已经连续更新了三次Flash。 就在前一天,Anthropic刚发布了“全球最先进的”Fable 5.1和Mythos 5.1;OpenAI也已经开始为下一代模型Astra预热,官方称其将“很快”上线。新一轮前沿模型大战正在开打,谷歌要是再不拿出点“大牌”,留给Gemini 3的型号已经不多了。 只看Benchmark,Gemini 3.8 Flash在部分任务上已接近Opus 5。 在长程软件工程测试DeepSWE v1.1中,Gemini 3.8 Flash拿到73.7%,距离Opus 5的74.0%只差0.3个百分点;Terminal-Bench 2.1上,它甚至以89.4%超过了Opus 5的89.1%。 谷歌并没有顺手给它涨价。Gemini 3.8 Flash的API输入价格仍然是0.75美元/百万Token,输出3.75美元/百万Token,和上一代3.7 Flash完全一样。 但这一次,便宜并不像看上去那么简单。 谷歌自己也提醒,3.8 Flash会比上一代“work harder”——它会进行更多推理、调用更多工具,也消耗更多Token。Artificial Analysis的首轮测试里,3.8 Flash的单任务成本反而比3.7 Flash上涨了约40%。 也就是说,虽然Token没涨价,但完成一件事变得更贵了。 谷歌啊,在性能上向顶级模型学习就够了,不要连这种事情也学Anthropic啊…… Flash碰上了旗舰模型 从谷歌公布的Benchmark来看,Gemini 3.8 Flash这次最明显的提升仍然集中在Coding和Agent能力。 和3.7 Flash相比,它在长程软件工程测试DeepSWE v1.1上的成绩从65.3%提高到73.7%,一下涨了8.4个百分点,距离Opus 5的74.0%只差0.3个百分点。 Terminal-Bench 2.1也是类似的情况,在这个命令行Agent实战测试里,3.7 Flash此前已经拿到85.8%,而3.8 Flash进一步提高到89.4%,略微超过Opus 5的89.1%。 另外,面向金融分析任务的Vals Finance Agent v2中,3.8 Flash拿到61.4%,高于Opus 5的58.6%;Harvey的法律Agent测试中,3.8 Flash为10.0%,Opus 5为6.7%;衡量多学科专家级推理能力的HLE-Verified上,两者则分别为54.9%和54.4%。 谷歌因此把3.8 Flash定位成目前“最智能的Flash主力模型”,重点面向长程软件工程、自治Agent和复杂企业工作流。 至少在一部分Coding和Agent任务里,Gemini 3.8 Flash已经跑到了Opus 5身边。 不过,暂时还没能实现完全赶超。 在更难、更强调通用Agent能力的Terminal-Bench 4.0上,3.8 Flash只有19.1%,而Opus 5达到了51.8%;GDPVal-AA v2知识工作测试中,3.8 Flash为1545 Elo,Opus 5则达到1824;测试电脑操作能力的OSWorld 2.0上,两者分别为59.0%和75.4%。 独立评测给出的结果也更接近这种判断:Artificial Analysis跑完了Gemini 3.8 Flash的low、medium和high三档推理强度,其中high档在Artificial Analysis Intelligence Index上拿到59分,而Opus 5 max目前是63分。 顺便一提,昨天刚发布的Fable 5.1 max已经达到了66分,当前榜单前七个席位都被Anthropic模型的不同推理档位占据。 所以,准确地说,Gemini 3.8 Flash只能算是一款开始在部分旗舰任务上越级竞争的Flash模型。 速度上,它保持了“Flash”的优势。在Artificial Analysis通过Google API进行的测试中,3.8 Flash high的输出速度达到304.6 Token/秒,在其比较组195个模型中排名第一。 核心产品规格方面,3.8 Flash和上一代完全一样。它依然拥有约100万Token上下文窗口和65,536 Token最大输出,支持的主要工具能力也保持不变。谷歌的模型卡直接说明,3.8 Flash建立在3.7 Flash之上,是一次继续迭代,而非底层模型换代。 和Gemini 3.8 Flash一起升级的,还有Gemini 3.8 Flash Cyber。 新的3.8 Flash Cyber在CyberGym漏洞发现测试中超过上一代3.5 Flash Cyber;在谷歌覆盖20种编程语言的内部真实漏洞测试中,成功率超过70%;在CWE-Bench自动漏洞修补测试中则达到了47.2%,超过GPT 5.6 Sol。 在“安全模型”上,谷歌和Anthropic的做法不太一样。Fable 5.1和Mythos 5.1本质上是同一个底层模型,只是通过不同的网络安全和生物安全限制区分开放范围;谷歌则从3.5 Flash开始单独做了一条Cyber支线,在Flash基础上针对漏洞发现、验证和修补进行专项微调,同时为Cyber版本采用更宽松的网络安全限制。 有意思的是,这种专项训练开始反过来影响主模型。 谷歌称,3.8 Flash和3.8 Flash Cyber共享同一个基础智能核心,而这一代在Coding和Reasoning上的提升,部分就来自网络安全这一高难度领域的训练。 模型价格正在从Token价格转向任务成本 如果只看API价目表,Gemini 3.8 Flash几乎是一次免费的性能升级。 它的输入价格依然是0.75美元/百万Token,输出3.75美元/百万Token,缓存读取0.075美元/百万Token,和3.7 Flash完全一样。性能涨了,Token单价一分钱没涨。 但真正跑起来,账单可不是这么算的。 Artificial Analysis的测试中,Gemini 3.8 Flash high完成一个Intelligence Index任务的平均成本达到0.58美元,而上一代3.7 Flash只有约0.40美元。 也就是说,同样的Token价格,单任务成本上涨了四成。 原因很简单:3.8 Flash变得更能“想”了,也更能花Token了。 Artificial Analysis发现,3.8 Flash high每个任务平均生成约4.8万个输出Token,比3.7 Flash增加了30%;在Agent测试中,它还会进行更多次交互。最终,虽然Token没有变贵,但为了完成同一套测试,需要购买的Token更多了。 值得注意的是,这并不是谷歌一家碰到的问题,Anthropic刚用Fable 5.1展示了一个更极端的案例。 Fable 5.1这次没有调整普通输入和输出价格,依然是10美元和50美元/百万Token,但An
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱