首页 时政热点 科技头条 智能AI 安全攻防 数码硬件 开发者生态 汽车 游戏 社会热点 开源推荐 医疗健康 归档 标签 关于
智能AI morning

答对了,理由却错了:港科大提出LexAgentHallu,追踪智能体的「隐性幻觉」

摘要

让智能体分析一起法律案件,它可能检索法规、整理事实、列出理由,最后给出一个看起来完全正确的答案。 问题可能出在更早的一步:它引用了错误法源,算错了程序期限,或者误解了工具返回的内容。后面的推理越流畅,这个错误反而越容易被最终答案遮住。 如今,法律大模型正在从单轮问答走向智能体。系统不再只是生成一段文字,而是会规划任务、调用检索工具、读取材料,并依据中间结果继续行动。人们把更多步骤交给模型,也就更难...

LexAgentHallu 一次幻觉 原论文 Figure 结果显示 RAWR 让智能体分析一起法律案件 它可能检索法规 整理事实 列出理由
2026-09-26 1 阅读 约10分钟阅读 机器之心
分享:
字号:
让智能体分析一起法律案件,它可能检索法规、整理事实、列出理由,最后给出一个看起来完全正确的答案。 问题可能出在更早的一步:它引用了错误法源,算错了程序期限,或者误解了工具返回的内容。后面的推理越流畅,这个错误反而越容易被最终答案遮住。 如今,法律大模型正在从单轮问答走向智能体。系统不再只是生成一段文字,而是会规划任务、调用检索工具、读取材料,并依据中间结果继续行动。人们把更多步骤交给模型,也就更难逐项确认它究竟看到了什么、为什么作出当前判断。 一次幻觉,开始有了跨步骤的后果。 香港科技大学的研究团队将目光放在了这条执行链上。他们提出智能体幻觉评测基准 Lex Agent Hallu ,把观察对象从最终答案扩展到完整轨迹,并将错误定位到具体步骤。 这项工作的出发点很直接:当一个智能体说“依据已经找到”“规则适用于当前事实”时,评测不能只看结论对不对, 还要检查支撑结 论的理由 是否真实、准确并且前后一致 。 论文标题:LexAgentHallu: A Hierarchical Benchmark for Profiling Hallucinations in Legal Agents 机构:香港科技大学 论文地址:https://arxiv.org/abs/2609.09754 一个错误法源 可以带偏整条法律推理 过去评测法律大模型,最常见的做法是给出一道题,再检查最终答案是否正确。到了智能体场景,同一个错误还要继续往下追,看看它影响了哪些检索、引用和判断。 把一条法规的名称写错,可能只留下一个文本错误。把已经失效的规定当成现行法,或者把下位规范当成上位法,却可能改变后续的规则选择、事实适用和救济建议。 智能体的风险因此不只来自“编造”。它也可能找到真实材料,却把材料用错;调用了正确工具,却填写了错误参数;看到了相关结果,却误读了结果所支持的范围。 一次幻觉,不再只是错误文本,而可能成为下一步法律判断的前提。 LexAgentHallu 因此不把最终答案视为唯一评测对象。它沿着智能体的执行轨迹逐步检查:系统如何规划、调用了什么工具、读到了什么结果、保留了哪些信息,以及怎样把事实与规则连接起 来 。 智能体的幻觉 究竟藏在哪里 LexAgentHallu 建立了一套 双层分类 体系。 第一层关注法律内容本身 ,包括法源、法律原则、程序规则和事实适用等错误。 第二层关注智能体执行过程 ,包括规划与推理、记忆,以及工具调用与观察结果理解等错误。两层合计包含 7 个中层类别和 27 个细粒度子类。 这套分类的目的不是给错误换一组名称,而是让问题能够被定位。法源伪造需要核验引用,事实—规则错配需要重新检查要件,工具参数错误需要约束调用接口,记忆偏移则指向上下文管理。 基准的构建也围绕“ 难例 ”和“ 可核验 ”展开。研究团队从多类法律任务中收集数据,过滤容易样本,再由具备法律训练背景的标注者核对答案、法源和推理轨迹,最后完成幻觉分类与专家复核。 图 1|LexAgentHallu 的四阶段构建流程。来源:原论文 Figure 1,第 4 页。 最终, LexAgentHallu 收录 3414 个实例,覆盖 17 个法律类别和 6 类任务 。它不只回答“系统错了多少”,还试图说明错误发生在哪里、属于哪一类,以及是否可能继续污染后续步骤。 最好的配置 也有 89% 的轨迹出现幻觉 论文评测了 18 种闭源和开源智能体配置 。结果显示,高幻觉率并不是个别系统的边缘现象。 即使表现最好的配置,仍有 89% 的执行轨迹至少出现一次幻觉 。 所有系统在法律内容层面的幻觉频率都不低于 87.5%。 这组结果并不等于“所有法律回答都有同样风险”。它说明的是,在这套强调困难样本和完整执行轨迹的评测中,当前系统很难从头到尾保持一条干净、可核验的推理链。 模型、工具和编排方式还会共同改变错误分布。ReAct 式的行动—观察循环在整体幻觉和法律内容幻觉上更有优势;法律专用工作流更能压低过程性错误;预先规划再执行的方式,在本实验中没有表现出稳定领先。 因此,部署智能体时,不能把模型、工具和流程拆开评估。更强的基础模型,仍可能在不合适的检索流程里放大错误;较小的模型,也可能通过更明确的工具协议和过程约束获得更稳定的表现。 答案已经正确 为什么理由仍然不可信 论文提出了一个很直观的指标: RAWR ,即 Right-Answer-Wrong-Reason 。它只观察最终答案正确的样本,再检查这些样本的执行轨迹中是否仍然存在幻觉。 结果显示, 在答案正确的前提下,平均仍有 68% 的轨迹包含至少一种法律内容幻觉,37% 的轨迹包含至少一种智能体过程幻觉。 图 2|RAWR 衡量“答对但理由错”的比例。红色为法律内容错误,蓝色为智能体过程错误。来源:原论文 Figure 4,第 7 页。 正确答案只能说明结论命中,不能证明推理链是干净的。 对法律咨询、合同审查和诉讼辅助等应用来说,这一区别尤其关键。用户需要的不只是一个看起来正确的句子,还需要能够追溯、核验并经得起反问的理由链。 如果系统只在输出端给出结论,却不暴露引用、推理和工具调用的质量,错误就可能在“答案正确”的表象下继续留存。 哪些任务更容易出问题 不同任务的幻觉频率并不均匀。开放式、长链条、需要综合事实与规则的任务,更容易暴露法律内容和过程错误。 图 3|不同任务类型下的幻觉频率。判决分析、案例分析等开放式任务处于高位。来源:原论文 Figure 5,第 8 页。 在任务类型上,判决分析的法律内容幻觉频率达到 1.00,案例分析为 0.95;法律推理、法律咨询、法律知识问答和判决预测也都处于高位。 过程性幻觉呈现出不同排序。判决分析达到 0.83,判决预测为 0.71。较短输出并不必然安全:只要任务要求多步证据整合、期限判断或规则适用,规划和记忆仍可能成为风险点。 真正决定风险的,不只是题目看起来有多难,而是系统需要完成多长的“事实—规则—程序—结论”映射。任何一个环节发生偏移,后面的步骤都可能在错误前提上继续推进。 幻觉会不会沿着链条一起发生 论文还分析了 27 个细粒度幻觉子类之间的共现关系。结果显示,这些错误并不是随机散点,而会形成具有结构的组合。 图 4|27×27 幻觉子类共现矩阵。红色表示正向共现,蓝色表示负向共现。来源:原论文 Figure 6,第 8 页。 程序期限错误与救济路径错误的共现提升度达到 2.82,程序步骤错误与程序后果错误达到 2.59。最强的跨组信号出现在法源层级错误与法律立场混淆之间,提升度达到 7.07。 这意味着,很多看似分散的错误可能共享同一个上游原因。法源层级一旦判断错误,后续的规则立场和事实适用就可能一起偏移;程序时钟一旦算错,期限、步骤和救济路径也可能连续出问题。 对系统治理来说,高风险错误可以被视为早期信号。一旦检测到法源层级、期限计算、程序步骤或事实要件映射异常,系统就应触发二次检索、规则校验或人工复核,而不是等到最终答案生成后再被动纠错。 从评测基准 怎样走向产品防线 LexAgentHallu 的直接价值,是把“幻觉很多”拆成可以处理的故障类型。把这套思路落到产品中,智能体至少需要三道检查。 生成前,明确边界 。系统需
这篇文章对您有帮助吗?

订阅66必读

每日精选科技资讯,直达你的邮箱