首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

AI可以评价AI科学家吗?使用自动多模型审查的自主研究生成系统的基准研究

2026-08-03 1 阅读 约2分钟阅读 Vaibhava Lakshmi Ravideshik, Mayank Kejriwal
分享:
字号:
arXiv:2607.28631v1 公告类型:新 摘要:能够自主研究的人工智能科学家系统有潜力显着加速科学发现。然而,评估和比较人工智能生成的论文的质量仍然是一个开放的挑战。我们使用自动同行评审系统提出并实施严格的基准测试协议,该系统利用前沿大型语言模型来评估四个核心维度的科学论文:原创性、科学严谨性、清晰度和重要性。我们评估了四个领先的人工智能科学家框架:\textit{Sakana AI (v1 & v2)}、\textit{CycleResearcher} 和 \textit{Data-to-Paper}。每个框架都在商业自主人工智能科学家公司 (FARS) 发布的 15 项研究提案上运行,生成 60 篇论文,我们与 15 篇 FARS 基准论文一起进行评估。使用三位独立的 LLM 审稿人(GPT-5.4、Gemini 和 Claude),我们发现 FARS 基准论文显着优于所有竞争框架,在 1--5 等级上达到 2.14--2.47 的平均分数,而其他系统的平均分数为 1.00--1.87。值得注意的是,在 Gemini 和 Claude 评估中,FARS 分数比次优系统高出 2 美元\倍$以上。我们发现 Gemini 和 Claude 之间存在很强的一致性($\rho$ = 0.907,$p < 0.001$),并且两者都与综合分数极强相关($\rho$ = 0.961,$p < 0.001$),验证了自动评估的可靠性。然而,GPT-5.4 表现出较弱的一致性($\rho \约 0.32$),表明它使用不同的标准评估论文。这些结果为人工智能科学家系统建立了第一个定量基准,并证明多模型法学硕士评估为评估自主研究质量提供了一个可扩展、一致的框架。
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱