智能AI
morning
为什么人工智能检测无法保证学术诚信
摘要
arXiv:2608.11256v1 Announce Type: new Abstract: Institutions use commercial AI detectors for academic integrity, yet detectors cannot distinguish AI editing from full LLM drafts and may treat both as ...
detectors
for
editing
misconduct
2023
2025
proxy
are
flagged
STEM
2026-08-13
1 阅读
约1分钟阅读
Jonathan A. Karr Jr, Grigorii Khvatskii, Ting Hua, Nitesh V. Chawla
字号:
arXiv:2608.11256v1 公告类型:新 摘要:机构使用商业 AI 检测器来保证学术诚信,但检测器无法区分 AI 编辑和完整的 LLM 草稿,并可能将两者视为不当行为。在对已发表的英文摘要(四个领域;2013 年至 2015 年 vs. 2023 年至 2025 年)的对照研究中,我们在 tau=0.50 的代理人类/人工智能标签下量化了这一政策失败。轻度“仅精炼摘要”编辑(符合指南的人工智能辅助的代理)被标记为 64% 至 80% (Pangram/GPTZero)。未经修改的 2023 年至 2025 年原件被标记为 9% 至 15%,非 STEM 比率远高于 STEM(p<0.001);高分跟踪的是长标记和学术词汇列表的密度,而不仅仅是作者的意图。在“无法检测到的 AI 人性化”之后,规避几乎是全部:只有不到 4% 的 AI 标记重写仍然被标记(人性化后检测率 <4%;FNR >96%)。诚实的人工智能编辑比人性化辅助规避的制裁风险更高。因此,检测器分数不应作为独立的不当行为证据。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱