首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

PDF当死,ARA该立!论文是时候Agent原生了

摘要

PDF当死,ARA该立!论文是时候Agent原生了 听雨 2026-08-10 21:53:22 来源: 量子位 文婷 发自 凹非寺 量子位 | 公众号 QbitAI 啥情况? 统治科研圈几十年的PDF格式,都需要因AI而“退休”… 因为以后 论文的第一读者不是人,而是AI?? 近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Arti...

Research 量子位 ARA Agent Native 叙事税 PDF当死 ARA该立 论文是时候Agent原生了 2026
2026-08-11 1 阅读 约9分钟阅读 听雨
分享:
字号:
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400"> PDF当死,ARA该立!论文是时候Agent原生了 听雨 2026-08-10 21:53:22 来源: 量子位 文婷 发自 凹非寺 量子位 | 公众号 QbitAI 啥情况? 统治科研圈几十年的PDF格式,都需要因AI而“退休”… 因为以后 论文的第一读者不是人,而是AI?? 近日,IEEE Spectrum重点关注了一项新研究—— ARA (Agent-Native Research Artifact)。它不仅能让AI理解研究结论,还能复现实验、灵活规避失败路线并继续推进研究, 让AI从辅助工具升级为科研协作者 据IEEE报道,ARA团队在一篇名为 The Last Human-Written Paper: Agent-Native Research Artifacts 的论文中,呼吁科学家们停止继续使用PDF撰写传统论文,并表示: AI需要一种不同的内容格式,而 AI的需求,理应被置于首位。 论文的第一作者 刘嘉晨 核心论点是: 一旦AI“榨干”了人类专家所有的数据,它就不再需要人类的任何输入。到那时,AI将开始自主进化。 现在这些只提升AI科学家的能力,却不改造科研知识的共享方式,就像在泥泞路上开F1赛车,难以复现并接续前人的工作。 而 PDF 就是过去科研知识共享的最核心代表。 是时候了,ARA当立。 为什么PDF该死? PDF代表的是传统论文的最终结果,是科研最后成果的最终呈现,但就是这种呈现,“有问题”。 ARA团队认为, 真实的科研从来不是一条从问题直通答案的直线 ,研究者往往要提出十几个假设、尝试几十种方案、调整无数次参数,在经历大量失败后,才能摸索出一条走得通的路径。 然而,当这些探索被写成论文时,那棵枝杈横生的“探索树”通常会被修剪成一条干净、连贯的成功路径。 而 ARA团队 将这种损失称为 “叙事税” ,即为了让研究成为一个有头有尾、逻辑自洽且成功的故事,大量的探索过程被主动舍弃, 后来者只能被闪耀的新突破亮瞎眼,却看不见前人踩过的坑、受过的罪。 除了“叙事税”,传统论文还存在着 “工程税” 。 一篇论文只要能让审稿人信服,便算完成了使命。 但“说服审稿人”与“让AI完整复现”完全是两套标准。 模型版本、运行环境、超参数、预处理方式、训练技巧……这些决定实验成败的关键细节,往往散落在正文、附录和代码仓库中,有些甚至从未被记录。 研究团队统计了PaperBench中的8921项专家复现要求,发现 仅有45.4% 在论文PDF中得到了完整说明。 对咱来说,实验信息少了,我们可以根据过往经验、求助导师或者不断试错补上; 但对 AI来说,论文里没写,那就意味着只能靠猜(或者瞎编) ,它也很无奈。 因此,ARA选择彻底换一种思路: 不再将线性叙事的论文视为科研成果本身,而是把研究重组为一个机器可直接操作的知识包。 这个知识包包含四个层次: 科学逻辑层: 记录研究解决了什么问题、为何采用该方法,以及哪些主张可被证伪。 可执行代码层: 不仅提供代码仓库,还包含复现实验所需的环境、配置与关键参数。 探索图层: 将实验过程还原为一张可追踪的路线图,成功与失败的方向、放弃某条路线的原因均被保留。 证据层: 将论文中的每一项主张关联至原始实验结果,方便AI核验结论,而非仅采信正文中的概括性描述。 概括来说,论文最后通过PDF呈现的只是 “我们最后做成了什么” ; 但如果通过ARA,展现的还有 “为什么这么做”“具体怎么做”“哪些方法已失败”以及“原始证据在哪里” ,追求的是 知识优于叙事 。 更形而上来说, PDF只有结果,ARA还包括了整个过程。 道理似乎是这个么道理,但“一切存在皆合理”,PDF能成为人类科研论文最终呈现形式这么多年,一定是有其内在合理性的。 ARA要取而代之,需要的就不光是理念了。 ARA真的比PDF好用吗? 为了让ARA真正跑起来,研究团队设计了三套配套机制: 1、Live Research Manager: 负责在研究过程中持续记录实验、决策、转向与失败路线; 2、ARA Compiler: 负责将现有的PDF和代码仓库转换为ARA格式; 3、ARA原生审稿系统: 负责让机器先行完成结构检查与复现验证,并将创新性、重要性与研究品位等判断留给人类审稿人。 为了体现ARA真的比PDF好用,研究团队分别从 理解 、 复现 和 延伸 三个维度进行了测试。 在理解测试中,研究人员设置了450个问题,要求AI从ARA或传统PDF加代码仓库中寻找答案。 结果显示,使用ARA的AI准确率达 93.7% ,而传统材料组仅为 72.4% ,相差 21.3% 。 差距最大的是“复盘失败” ,当问题涉及失败方案、替代路线和实验教训时, ARA组准确率为81.4%,传统材料组仅15.7% ——原因很简单, 传统论文里压根就没有这些信息。 在复现测试中,团队选取了15篇附带GitHub仓库的机器学习论文,设置了150项复现任务。 其中,ARA组的难度加权成功率为 64.4% ,传统组为 57.4% 。且 任务越难,ARA的优势就越明显 : ARA在简单、中等和困难三档任务中,分别领先 4.9% 、 5.6% 和 8.5% 。 但ARA的表现 并非一路开挂。 在最具挑战性的研究延伸环节,ARA组赢下了3项RE-Bench开放任务,但 另有2项被传统论文组反超。 不过,也有可取之处。 ARA组在全部5项任务中,都抢先摸到了那步最关键、最值钱的第一步实验操作: 利用失败记录迅速绕开已经被验证过无效的研究方向,省去大量重复探索。 这也对应了论文中的另一组数据。在论文分析24008次AI Agent运行中, 90.2%的资金成本都消耗在失败探索上 ,而传统论文几乎不会保存这些失败。 对刘嘉晨而言,这正是ARA最重要的价值。 在她设想的人机科研关系中,AI不再只是润色论文、查找资料或生成代码的辅助工具,而是能 真正成为参与阅读、复现和延伸研究的科研主体。 而 科研人员则可以更加聚焦于那些AI难以替代的判断、创新和品味工作 ,即判断问题是否重要、工作是否真正新颖、某条路线是否值得投入。 ARA也并非完美 不过,虽然ARA的成绩单看起来非常亮眼,但它目前更像一位野心勃勃、天资聪颖却根基尚浅的高一新生,才刚入学就想要在高考中考进北大。 它离成为“PDF终结者”还有很长的一段道路要走。 篇幅有限,简单说三点。 ARA的第一个缺陷,就是它目前 实验的范围较窄,普适性较弱 ,只覆盖了天然适合代码复现的机器学习领域,能否用于湿实验或理论学科还尚未得到验证。 第二个问题,就是 隐私和数据安全问题。 ARA目前不仅还没有实现细粒度的访问控制,缺少沙箱执行和内容异常检测,相关规则和标准也还没完善妥当。 要是你就这么大大咧咧地把机密数据喂给它,小心下一秒就被你的竞争对手拿走哦。 第三个是 不可避免的AI幻觉和路径依赖问题。 在15篇论文的复现实验中,传统材料组出现了2次结果编造,ARA组也出现了
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱