智能AI
morning
AI代写论文露馅?顶刊主编一问,作者啥都答不上来
摘要
编辑|Panda 你写了一篇论文,现在问你三个问题:你这篇论文的问题设定是什么?这个符号代表什么?摘要里说的这个结论,在正文哪一部分得到了支撑? 如果论文真是你写的,那这些问题肯定很简单,甚至不用准备就能答出来。 但在机器学习期刊 TMLR(Transactions on Machine Learning Research)最近的一次小规模试验中, 有三篇论文 的作者连这 些基础问题都答不上来 。...
Shah
TMLR
篇论文
Panda
你写了一篇论文
现在问你三个问题
你这篇论文的问题设定是什么
这个符号代表什么
摘要里说的这个结论
在正文哪一部分得到了支撑
2026-09-26
1 阅读
约10分钟阅读
机器之心
字号:
编辑|Panda 你写了一篇论文,现在问你三个问题:你这篇论文的问题设定是什么?这个符号代表什么?摘要里说的这个结论,在正文哪一部分得到了支撑? 如果论文真是你写的,那这些问题肯定很简单,甚至不用准备就能答出来。 但在机器学习期刊 TMLR(Transactions on Machine Learning Research)最近的一次小规模试验中, 有三篇论文 的作者连这 些基础问题都答不上来 。 9 月 16 日,TMLR 在官方博客上发布了一篇题为《 向作者询问他们自己的论文 》的文章,作者是该刊联合主编之一、卡内基梅隆大学(CMU)的 Nihar B. Shah。他在两周的主编轮值期内,挑出 10 篇原本要被直接拒稿(desk rejection)的投稿,没有直接拒掉,而是逐一约作者「聊聊」。结果,这 10 篇论文还是全部被拒了。 https://medium.com/@TmlrOrg/asking-authors-about-their-own-papers-3d2e04e5dee0 同为 TMLR 主编的 Gautam Kamath 在 𝕏 上转发时称这是一次「英勇的实验」,并说它证实了很多人心里早有的猜测: 一部分投稿者其实并不知道自己的论文里写了什么 。 抽查 10 篇待拒稿,都拒了 据 Shah 的描述,这次试验发生在 2026 年 8 月 14 日至 28 日他轮值主编期间。他从待直接拒稿的论文中非正式地抽取了 10 篇,通过审稿平台 OpenReview 给作者发去一条简短消息:一位主编希望在送审之前和您聊聊,以便更好地理解这篇论文,如果方便,请发邮件告知可约时间。 消息发出后,事情迅速分化。 一篇论文的作者直接撤稿;一位作者回复说手头事情太多,没空通话;剩下 8 篇约上了会,但其中一位作者到点没有出现。 最终与 Shah 见上面的,是 7 篇论文的作者。他们身份各异,包括本科生、硕士生、博士生、高校教师和独立研究者。 这批论文大多是单作者论文,但并非全部。 Shah 的提问分两类:一类是关于问题设定、符号和论文所声称结果的基础问题,另一类是关于具体技术表达式、理论结果和实验设计选择的细节问题。 7 场会谈里,只有 1 篇论文的作者答上了全部问题。 另有 3 篇的作者能讲清高层思路,但一被追问技术细节就陷入困难。 最糟糕的是另外 3 篇,作者连基础问题都答不上来,而且这 3 篇 全是单 作者论文。 Shah 写道,其中两位作者看起来对自己论文的内容几乎没有实质理解,另一位则找不到摘要中声称的几项关键结果究竟在正文哪里给出或得到支撑。 唯一全部答对的那篇,也没能过关。Shah 在审读中发现,论文的一项主要结论存在重大错误,作者随后也承认了。TMLR 对这篇作了直接拒稿,但允许作者在修正错误或收窄结论后重新投稿。 其余 9 篇则被直接拒稿,且不开放重投。 会后的两个插曲 Shah 在文中还记录了两件事,读来颇具黑色幽默。 第一件: 有两篇论文的作者在会上答不出基础问题,会后却给他发来了书面答复 。Shah 把这两封邮件交给 AI 文本检测工具 Pangram,结果均被判定为「 100% AI 」。 第二件:另一场会谈中,一位作者试图向 Shah 介绍自己用到的分析方法,结果讲着讲着, 无意间完整描述了一套 p-hacking 流程 ,也就是通过反复调整分析方式、直到数据「显著」为止的做法。 需要说明的是,Shah 本人并不排斥 AI。他在文中坦言,为了在两周内读完 8 篇论文, 他自己也借 助了 LLM 来辅助理解 ,甚至学习了一些此前不熟悉的概念。他关心的并不是作者有没有用 AI,而是作者能否为署着自己名字的内容负责。 为什么要做这件事? TMLR 创刊于 2022 年,由 JMLR 背后的团队运营,以「只看结论是否被证据支撑,不以新颖性和 SOTA 作为拒稿理由」的审稿标准著称。它的审稿人、执行编辑(Action Editor)和主编全部是无偿志愿者,这也让它在今年的投稿潮中格外吃力。 根据 TMLR 6 月发布的公告,过去一年里其投稿量增长到原来的三倍,其中单作者投稿更是暴增至 13 倍,编辑部甚至见过 有人一天投出 5 篇论文 。Shah 在最新文章中给出的另一组数字更直观:2023 年,TMLR 直接拒稿的比例约为 6%,如今已升至约 53%,也就是说超过一半的投稿走不到外审环节。 面对这种局面,TMLR 在今年夏天密集推出了一系列措施。 其一是 按作者设置年度投稿配额 。与许多会议「每人最多 N 篇」的固定上限不同,TMLR 采用了一种「调和式」配额规则,一篇论文消耗每位作者的额度会随合著者人数增加而递减。具体参数是:只投单作者论文的人,每年最多投 2 篇;若所有投稿都是 9 人合著,则每年最多 9 篇;活跃的审稿人和执行编辑额度翻倍。该规则从 7 月 1 日起执行。TMLR 在公告中解释,之所以不按人数平摊,是为了防止有人靠挂名「凑作者」来换取更多投稿额度。 其二是 引入 AI 审稿 。TMLR 7 月宣布,每篇投稿将在常规人工审稿之外附带一份 AI 生成的审稿意见,只评估论文的「可靠性」,即结论是否有准确、清晰、令人信服的证据支撑,不做主观判断,也不给出录用建议,最终决定仍由执行编辑作出。经过评测,TMLR 选用了 CSPaper 的 AI 审稿器。 其三是 把「写得清楚」写进录用标准 。8 月 28 日,TMLR 修改了原有的「受众兴趣」标准,明确要求论文要向读者清楚地传达其发现。公告直言,当前的 AI 写作往往绕、术语堆砌、难以读懂;如果一篇论文几乎完全由 AI 生成、缺少人的参与,至少以现有 AI 系统的水平,它很可能达不到这一标准。 Shah 在文章结尾总结,这次约谈让编辑部对现有的直接拒稿流程更有信心, 配额制度和对清晰写作的强调也被证明很有帮助 。 不只是 TMLR TMLR 的遭遇并非孤例。今年以来,AI 领域几个重要的发表渠道都在与同一个问题搏斗。 6 月初,NeurIPS 官方博客披露,NeurIPS 2026 立场论文(Position Paper)赛道的 971 篇投稿中,有 273 篇(28.2%)被 Pangram 判为 AI 分数 100%。 https://blog.neurips.cc/2026/06/02/ai-generated-papers-in-the-neurips-2026-position-paper-track/ 该赛道今年明确要求论文必须「实质上由人类撰写」,AI 只能用于文字润色等外围修改。NeurIPS 同时指出,AI 写作的增长是全面性的:在「评测与数据集」赛道,Pangram 分数不低于 90% 的论文数从 2025 年到 2026 年增长了十倍以上。不过 NeurIPS 也承认检测结果对参数敏感,改用中等尺寸的检测窗口后,AI 分数在 90% 至 100% 区间的论文比例会从 42.7% 降至 12.7%。 更早的 5 月中旬,arXiv 计算机科学板块负责人 Thomas G. Dietterich 在社交媒体上宣布了一项明确罚则:如果一篇投稿中存在作者未检查大模型输出的「确凿证据」,比如幻觉参
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱