智能AI
morning
LitReview Arena:用战斗式同行评审平台评估文献评审代理
摘要
arXiv:2608.21374v1 Announce Type: new Abstract: Literature reviews are essential to scientific progress, but rigorously evaluating automatically generated reviews remains difficult because many aspect...
are
expert
and
with
reviews
research
utility
LitReview
Arena
protocol
2026-08-25
1 阅读
约1分钟阅读
Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li
字号:
arXiv:2608.21374v1 公告类型:新 摘要:文献综述对于科学进步至关重要,但严格评估自动生成的综述仍然很困难,因为研究效用的许多方面取决于专家判断而不是参考重叠指标。我们推出了 LitReview Arena,这是一个战斗式评估平台,具有针对文献综述质量量身定制的结构化协议:具有人工智能论文写作经验的领域专家比较匿名草稿,与他们专业范围内的主题进行匹配,并根据五个文献综述特定标准提供维度结果。从这个协议中,我们收集了大约 3000 个专家判断,每个判断都包含五个维度的结果,结果表明,即使是当前最强大的系统,在与人类草稿的整体效用方面的决定性比赛中也只能赢得 23.0% 的胜利,而 Sonar Deep Research 等代理法学硕士的表现远远优于基础语言模型 60% 以上。我们进一步发现,现有的法学硕士作为法官的方法与人类专家严重不一致(Spearman's rho = 0.467),特别是在论文结构和研究建议等综合性标准方面。使用收集到的偏好数据,我们提供了一个专家校准的评估器 LitJudge,它提高了 Spearman rho=0.78 的一致性,与专家间的一致性相当;代码和数据可在 https://github.com/VanellopeAsher/LitReview-Arena 上公开获取。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱