首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于

模型故意变得更笨

摘要

Reasoning scores keep climbing while per-token compute keeps dropping. GLM-5.2 scores 99.2% on AIME 2026 with about 40 billion parameters active per token. Qwen3.5 scores 91.3% with 17 billion active....

the and parameters you for per billion active that models
2026-08-17 1 阅读 约5分钟阅读 hruvhwe
分享:
字号:
推理得分不断攀升,而每个令牌的计算量不断下降。 GLM-5.2 在 AIME 2026 上得分为 99.2%,每个代币约有 400 亿个活跃参数。 Qwen3.5 得分 91.3%,活跃量 170 亿。 DeepSeek V4-Flash 运行 130 亿活跃。就规模而言,据传 GPT-4 到 2023 年将运行约 2800 亿个活跃参数,而且它几乎无法解决 AIME 问题。在小端,Qwen3.5 9B 配备 6GB 量化 VRAM,在人工分析智能指数的 10B 参数下,其得分大约是次佳模型的两倍。如果您只查看数学和代码基准,您会得出结论,模型的每个参数都以荒谬的速度变得更加智能。根据这些基准,他们是。问同样的模特一个简单的事实问题,情况就会翻转。在 SimpleQA(不允许使用任何工具的事实回忆基准)上,当前的领先者是 Gemini 2.5 Pro,为 53%,因此即使用钱能买到的最好的回忆仍然会漏掉一半的问题。小型号几乎没有注册。人工分析在其知识基准上测量 Qwen3.5 4B 和 9B 的幻觉率为 80% 至 82%,这意味着当他们不知道事实时(大多数时候),他们会编造一个事实。向 9B 询问一位 19 世纪小数学家的出生年份,你会得到一个自信的、可信的、错误的答案。参数数量并不是免费下降的。实验室正在用世界知识换取推理能力,而且这种交易是经过深思熟虑的。事实的参数占用空间。对知识容量的研究(“语言模型的物理”系列具有最清晰的测量)将其置于每个参数两位事实知识的数量级上。如果你想要一个知道每个维基百科小人物的出生年份、每个荷兰城市的人口以及每个 npm 包中每个函数的参数顺序的模型,你就需要付出权重的代价,这也是前沿模型增长到数万亿参数的一个重要原因。推理比事实压缩得更好,因为它是一组相对较小的反复应用的程序:将问题分解为多个部分,跟踪中间状态,检查自己的工作,在步骤失败时回溯。事实证明,对可验证任务的蒸馏和强化学习可以很好地将这些过程转移到小型模型中。 Phi-4 有 140 亿个参数,在综合教科书式数据上进行了大量训练,它擅长数学,但不擅长琐事,它可以准确地告诉你它的训练数据包含什么。这种混合过去看起来像是合成数据方法的限制。现在看起来就像是设计目标。在贸易中幸存下来的知识已经成型。这些模型是多面手:他们几乎对所有事情都了解一点,但几乎一无所知。询问有关 PostgreSQL 的信息,它知道它是什么、它擅长什么以及 MVCC 的大致工作原理,但询问哪个版本添加了特定的规划器功能,您又回到了虚构的事实。这是保留权重的正确层,因为广度可以让模型理解问题的内容,知道要查找什么,并判断来源是否可信。深度的检索成本低廉,存储成本昂贵,因此它是需要保留的部分。事实会腐烂,程序不会腐烂 一次前沿训练需要数月时间,耗资数亿美元,而一旦结束,其中的事实就开始变得陈旧。库 API 发生变化、价格发生变化、人们更换工作,2024 年模型对 JavaScript 生态系统的看法有一半在该模型发布之前就已经过时了。你在举重中加入的每一个事实都有保质期,而恢复它的唯一方法就是再次训练。程序不会腐烂。代数在 1970 年的工作方式与现在相同,分解问题或发现两个来源之间的矛盾也是如此。一个主要是程序性的、只包含少量事实的模型不会像知识密集型模型那样老化。它的训练截止时间就不那么重要了,因为世界的现状本来就不应该生活在举重中。我认为这是整个方法的最佳论点:它将昂贵、缓慢的工件(经过训练的模型)与每天变化的东西(真实的东西)分离开来。工具承载着知识 如果模型不知道某些东西,那么其他东西就必须知道,而那个东西就是工具:知识库检索、工具调用、网络搜索、充满文档的文件系统。我之前写过,Rust 是代理的工具,是廉价的机器可检查反馈的来源。从另一面看也是同样的形状。该模型提供推理,并且它推理的所有内容都在运行时提供。您已经可以看到代理以这种方式工作。编码代理不需要记住您的依赖项的 API 表面,因为它会在调用任何内容之前 grep node_modules 或读取文档,并且其答案基于您实际安装的版本,而不是主导训练数据的版本。雷卡
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱