智能AI
morning
EMNLP 2026主会|北大×易鑫AI Lab:大模型明明「知道」,为什么还会答错?
摘要
当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论: 它不会做这道题 。 但这个结论真的可靠吗? 想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。 北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作 ,共同追问一个看似简单、却可能影响我们解...
Qwen3
Answer
lexical
OOD
YIXIN
Readout
Bottleneck
probe
830
label
2026-09-18
1 阅读
约10分钟阅读
机器之心
字号:
当大语言模型在逻辑题上给出错误答案时,我们通常会下一个很快的结论: 它不会做这道题 。 但这个结论真的可靠吗? 想象一下:学生已经在草稿纸上写出了正确推导,交卷时却把答案栏涂错了。只看答题卡,我们会说他 “不会”;如果能同时检查草稿,就会发现问题出在最后一步的表达。 北京大学研究团队 和 易鑫(YIXIN)AI Lab 围绕大模型推理评测与内部表征展开合作 ,共同追问一个看似简单、却可能影响我们解读 Benchmark 结果的问题: 当模型答错一道逻辑题时,它是真的没有想出来,还是已经想到了,却没有把正确答案表达出来? 这项研究提出了一个专用于大模型的诊断视角: 模型很可能已经在隐藏状态(Hidden States)中编码了正确答案,却在将其转换为最终候选分数的过程中,被输出层的系统性偏差给 “掩盖” 了 。作者将这一现象命名为 “读出瓶颈”(Readout Bottleneck) ,并设计了一套分阶段的诊断方法来验证 “答错” 究竟是能力缺失,还是表达失真。 该工作已被自然语言处理顶级会议 EMNLP 2026 主会接收(录取率 15.4%) 。 论文题目: Wrong Prediction, Right Answer: Recovering Evidence from Collapsed LLM Sequence Scores 作者: Qiyao Yan、Chenpeng Wang、Liangming Pan 合作单位: 北京大学、易鑫(YIXIN)YiXin-AILab Arxiv 链接:https://arxiv.org/abs/2608.31068 1. 一个常被忽视的混淆:答错,真的等于不会吗? 在目前的逻辑推理评测(多选题或固定选项)中,标准流程非常统一: 1)输入题干 ,2)计算每个候选答案的 Logit 分数,3)取最高分项 ,4)统计准确率 。大家习惯性地将最终得分低,等同于 “模型缺乏该项推理能力”。 但作者团队指出,这里存在一个被长期混淆的因果断裂:模型最终输出错误,究竟是因为内部根本没推导出来,还是推导出来了,却在最后一步的输出映射中被 “读坏了”? 图 1:论文的三步诊断链。关键问题不是 “模型最后选了什么”,而是 “正确答案的信息在哪一步丢失了”。 为了把这两者彻底拆开,作者在不同难度梯度的测试集上(包括基础同分布的 id 、考查更长推理链的 depth 、以及替换了词汇表达的困难切片 lexical-OOD ),对模型推理过程中的不同 “读出” 节点进行了对比: 隐藏状态早已 “知道” 答案 :不管是在提示词刚结束时(Prompt-end probe),还是在紧接着 Answer: 标记之后的节点(Answer-slot probe),线性探针都能以极高的准确率解码出正确答案。以 Qwen3.5-9B 在最难的 lexical 切分为例,此时探针准确率高达 0.830。 两段式的 “表达坍塌” :然而,当这股正确的逻辑信息流经模型固有的词表矩阵(Same-position label logits)时,信号开始大幅衰减至 0.574。更致命的是,哪怕模型在预测第一个词元时(First-label-token score)还勉强保留了一丝优势,一旦将整个候选短语的对数概率进行累加(Full string score),误差就会被无限放大,准确率瞬间跌至 0.333—— 彻底沦为三分类的完全盲猜。 在 Qwen3.5 系列模型 的受控逻辑测试(Lexical-OOD)上,对比结果如下: 表1:Qwen3.5 模型不同“读出”方式的准确率对比。 当在模型输出答案标签前接入线性探针(Linear Probe)时,探针能以极高的准确率(如 Qwen3.5-9B 在 lexical-OOD 切分上达 0.830)解码出正确答案。然而,当这股信息流经词表投影,聚合成最终候选序列分数时,准确率却断崖式下跌至 0.333(等同于三分类的随机盲猜)。模型并非逻辑推导失败,而是被输出层的系统性结构偏置(如偏好 “unknown” 等安全标签)掩盖了真实判断。 更夸张的是,在原生序列打分下,Qwen3.5-9B 在 1,000 道测试题中竟有 999 道被判为了同一个标签 (unknown)。这显然不是每道题都在逻辑上遭遇了独立失败,而是输出层存在一个极强的全局偏好,把样本之间的实例级逻辑差异硬生生碾平了。 甚至在未经任何指令微调的原始底座模型(Base Model)上,这一现象依然稳固存在(Qwen3.5-9B-Base 探针 87.3%,序列打分仅 36.1%)。 核心结论:模型的推理信号并未在深层消失,但从内部隐变量走向原生词表与序列累加的过程中,存在一个严重的读出瓶颈(Readout Bottleneck)。 2. 极简修正:只动 2 个参数,唤醒被 “封印” 的推理能力 如果原生序列分数真的只是一层被 “全局偏置” 扭曲的信号,那它内部是否还残留着针对具体题目的相对排序? 论文提出了一个判定逻辑:将候选分数的生成过程解构为两部分: 其中 是随具体题目变化的逻辑信号,而 则是与标签绑定、不随样本改变的结构性偏置。当 过大时, 自然被全局绑架。 为了验证 是否仍然有效,作者设计了一种极度克制的诊断干预:不对模型参数做任何改动,也不使用任何测试集标签,仅对每个候选类别增加一个全局标量偏移量 : 在三分类任务中,固定一个基准项后, 自由参数仅仅剩下 2 个 。这两个参数完全在无标签的上下文分数上,通过网格搜索使其预测分布贴合类别先验(如均匀分布)完成拟合,随后直接在独立的 Held-out 测试集上冻结评测。 这种干预的能力上限被死死限制住: 它只有 2 个参数,绝不可能学会复杂的 “输入 - 推理 - 输出” 任务映射; 它是全局常数平移,不可能改变同一个类别内部不同样本的相对好坏。 如果这区区两个参数能在测试集上救回大量错题,唯一的解释就是:模型给出的原始分数差值里,本来就保留着正确的相对排序证据。 图 2:灰条为原生序列准确率(虚线为 1/3 随机线),蓝条为两参数无标签先验修正后成绩;下方绿条展示逐样本净拯救数(校准单独答对数减去原生单独答对数)。 实验在四大推理任务上展现出惊人的一致性: Synthetic 逻辑任务 :Qwen3.5-4B 与 9B 的准确率从 33.3% 盲猜直接拉升至 57.0% 和 60.2%,净挽救错题超过 230 道; ProofWriter 自然语言演绎 :模型从完全坍塌的 33.3% 暴涨至 65.3% 和 67.8%,单任务挽救了超过 320 道原本判错的题; FOLIO 与 ANLI 进阶推理 :即使面对高度复杂的一阶逻辑与对抗性 NLI,修正依然带来了 9 到 29 个百分点的稳健恢复。 跨模型验证同样成立:OLMo-2-1B 的准确率从 0.362 提升至 0.566,Llama-3.1-8B 从 0.333 提升至 0.477(置换检验均为 )。 更关键的是 样本效率(Sample Efficiency) :因为拟合的只是极低维的偏置,在 30 次随机子采样中, 仅需 25 个无标签样本 ,Qwen3.5 就能找回绝大部分丢失
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱