智能AI
morning
AI倒查论文100年!99.2%的顶刊都有问题…
摘要
AI倒查论文100年!99.2%的顶刊都有问题… 听雨 2026-08-10 21:58:46 来源: 量子位 程浅 发自 凹非寺 量子位 | 公众号 QbitAI 谁再说科研 已经没有新问题了 ?好方向全被前人占满了?? 如果我说—— 那些已经发表的顶刊论文里,大多都有问题呢? 最近,有研究者用AI Agent「学术打假」后发现: 2026年国际机器学习大会(ICML)上报告的92篇论文中,有5...
量子位
Agent
Agent对ICML
的参数
AI倒查论文100年
的顶刊都有问题
2026
凹非寺
公众号
QbitAI
2026-08-11
1 阅读
约8分钟阅读
听雨
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> AI倒查论文100年!99.2%的顶刊都有问题… 听雨 2026-08-10 21:58:46 来源: 量子位 程浅 发自 凹非寺 量子位 | 公众号 QbitAI 谁再说科研 已经没有新问题了 ?好方向全被前人占满了?? 如果我说—— 那些已经发表的顶刊论文里,大多都有问题呢? 最近,有研究者用AI Agent「学术打假」后发现: 2026年国际机器学习大会(ICML)上报告的92篇论文中,有58篇已经无法复现。 真假??莫非,猛发顶刊的机会真的来了? 顶会论文正在集体被AI「打假」 通常一篇论文能够进入顶级会议,就说明它已经经过了同行评审。 然而受精力所限,同行评审审稿人 几乎没有时间 从头下载数据、运行模型或复现实验,以验证论文中的每一个实验结论。 与此同时随着AI领域的论文数量爆炸增长,模型越来越复杂,实验规模越来越大,一篇论文背后的代码、数据、参数设置 可能涉及数百个细节 。 论文的可验证性也就变得越发重要,论文发表了,但 其中的结论能被重新跑出来吗? 目前,AI Agent大大 降低了这种验证和复现的成本 。 7月22日,美国某研究审查公司用AI Agent对ICML 2026全部168篇口头报告论文进行了系统性的结果复现审计。 168篇论文中有92篇拥有至少5条可供验证的结论性声明。 最终的结果是:AI Agent能够成功复现超过四成结论的,只有34篇;而能复现八成以上结论的, 仅有8篇 。 不过需要说明的是,“无法复现”和“研究造假”之间还存在着巨大区别。 复现失败的原因 包括不限于 代码缺少关键文件、依赖库版本断裂、运行结果与论文不符,还有4篇论文依赖的模型已下线,这意味着实验结果已经永久性地无法被任何人复现。 除此外,还有一些就 错的比较离谱 了—— 比如,一篇论文将「仅训练基础模型0.77%的参数」作为核心卖点,但其实际开源的checkpoint训练了6.31%的参数, 相差约8倍 。 另一篇论文放了一张基于某评判模型的可靠性表格,但其开源代码中根本不包含该评判模型,也没有任何脚本能够生成表格里的结果。 无独有偶,2026年抱抱脸与AlphaXiv联合发起针对ICML 2026的「Agent Reproduction Challenge」 挑战赛 ,邀请研究者使用AI Coding Agent对ICML 2026接收的论文进行自动化复现, 结果同样很不乐观。 类似的趋势在论文错漏检测中的体现更令人惊异。 2025年底,一项研究开发了基于GPT-5的论文检查系统,用于分析已经发表在顶级 AI 会议和期刊上的论文,寻找可以客观验证的问题。研究者非常明确地表示: 我们只看「客观错误」,我们不管论文的创新性和研究价值。 最终结果显示,平均每篇论文被检测出4.7个客观错误, 99.2%的论文至少被标记出了一个问题 。 △ 图片系AI生成 从错误类型来看,数学与公式错误占比最高,达到54.0%(包括方程式写错、推导逻辑有漏洞、证明中的错误假设等)。 大约30.8%的NeurIPS论文和23.8%的ICLR论文包含 至少一个可能影响结果解读的实质性错误 。 更值得注意的是时间趋势:NeurIPS论文的篇均错误数从2021年的3.8个上升至2025年的5.9个,涨幅55.3%。 …… 或许在今后,论文发表不再意味着研究宣告「胜利」,而只是再次进入了下一轮AI验证的开始。 学术萌新重大利好,不做实验也能发顶刊 所以,朋友们,这对正在愁选题的人来说,可能还真是个相当意外的「利好」。 查文献挑错、写勘误,本来就是学术圈里正经八百的产出形式,如今看来,完全的学术蓝海啊。 具体怎么下手?给愁选题的学术萌新们支几招: 第一,转变研究思路,不卷前沿卷过去。 从“找新选题”转向“找旧论文里的异常点”,重点关注那些被 大量引用但争议较少的经典论文 。毕竟“99.2%的论文至少有一处错误”。 第二,让AI帮你制作知识地图和研究谱系。 这种知识地图可以帮你理解——哪些是真正的奠基性工作?哪些研究观点目前还存在争议?哪些结论被大量引用但缺少验证?不同论文之间的引用关系是什么?从而由此找到 过去难以发现的连接和异常 。 第三,Ask anything. 科学史上的很多重要突破并不来自于提出全新的问题,而来自 重新审视一个长期被接受的假设 。 例如:一个经典实验是否按照今天的标准被验证过?一个被广泛引用的结论,是否存在未被注意的限制条件? 过去,这种追问成本非常高,研究者需要花费大量时间查阅原始文献、比较实验细节,而如今AI让这种成本几乎归零了。 AI或将开始重整科学史 最近,浙江实验室理论化学家Pios在使用AI预测分子沸点时,发现结果与 一份75年前的化学数据库 存在明显冲突。 对此,任何人的第一反应可能都是“那肯定是我错了呗”。 Pios也不例外,他连忙检查自己的模型。但在手动回溯了原始文献之后他发现: 天呐,AI竟然是对的那一个 。 Pios大为惊讶,随后用AI继续核查,竟然还发现了一份 约一个世纪前 且被学界公认权威的沸点测量值 也是错的 。 要知道,这些数据已经被经年累月地引用、吸纳于后代的研究之中。 这类问题此前长期未被发现可能与 科学文献的规模直接相关 。 △ 图片系AI生成 现代科学论文的数量已经远远超出任何个体研究者的阅读极限,例如,仅一家人工智能顶会ICLR的年度投稿量就从2018年的1013篇上升至2026年的19619篇。 在这样的规模下,一处最初出现在某篇论文中的错误一旦被后续文献反复引用,就会沿着引用链持续传递, 形成事实上的学术共识。 由于年代久远、引用链条复杂,加之复核工作耗时巨大而学术回报有限,绝大多数已进入文献体系的错误 从未被系统性地审视过。 但如今一切都松动了,至少在技术能力上,人们首次具备了大规模重审过往科学文献的可能。 不过,以GPT-5驱动的Paper Correctness Checker为例,其检测精确率为83.2%,且每次检测中仍有约四成真实错误未被检出。 可以说,此类AI事实核查工具本身不足以担任科学文献的判官,AI核查工具的输出结果 最后还需要人工来审核。 版权所有,未经授权不得以任何形式转载及使用,违者必究。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱