智能AI
morning
审核综合回忆录:根据其所描述的生活记录来衡量法学硕士生成的自传中的场景级虚构
摘要
arXiv:2608.23640v1 Announce Type: new Abstract: When a large language model (LLM) is asked to write a person's life, how much of what it writes actually happened? We present a scene-level case-study a...
the
days
and
scene
corpus
day
verification
failure
LLM
person
2026-08-26
1 阅读
约2分钟阅读
Heather Renze
字号:
arXiv:2608.23640v1 公告类型:new 摘要:当一个大型语言模型(LLM)被要求书写一个人的一生时,它所写的有多少是真实发生过的?我们提出了场景级案例研究审计——基于非系统性文献检索,根据我们所知的特定主题的真实语料库对法学硕士生成的自传进行了首次量化审计。本文的主题和作者是同一个人:一本 366 天的“每天一页”的第一人称轶事条目书是由一位会话法学硕士起草的,其记录的输入是一个模板、两个典型的日子和每天的引言(不是她的语料库),随后每天都使用分析前固定的四级标题在轶事场景级别上根据独立验证语料库进行审核。我们将验证失败率定义为未评级为“已验证”的天数比例(场景得到积极证实):366 天中有 354 天失败,占 96.7%(Wilson 95% CI 94.4-98.1%)。仅 12 天就包含了证实的场景; 19 天 (5.2%) 主张与记录积极矛盾的主张;主要的失败模式是根深蒂固的漂移——真实的人、雇主和虚构场景中的环境——尽管其测量的份额因评估者而异。独立重新评级重复了标题(没有证据表明原始评级被夸大),同时表明四向分类法仅具有中等至中等的可靠性。使用当前命名模型重新生成相同天数会在相同输入下重现 100% 验证失败;受试者语料库中的接地生成显着提高了验证率,同时留下了大量的残余失败(83.3%)。我们提供测量方法、可重复使用的审计工具(我们认为其薄弱/未经验证的边界是不可靠的)以及具有量化效果的基础补救措施。
这篇文章对您有帮助吗?
订阅66必读
每日精选科技资讯,直达你的邮箱