RecodeX 重构消息,香港科技大学研究团队提出法律智能体幻觉评测基准LexAgentHallu,将评测对象从最终答案扩展到智能体的完整执行轨迹,构建覆盖法律内容与智能体执行过程两大维度的分层错误分类体系,收录3414个实例,覆盖17个法律类别与6类任务。

团队评测18种闭源和开源智能体配置后发现,表现最优的配置仍有89%的执行轨迹至少出现一次幻觉;在答案正确的样本中,平均仍有68%的轨迹存在法律内容幻觉。错误并非随机分布,上游的法源层级、程序期限等错误容易引发后续连锁偏移。

该基准可将幻觉拆解为可定位的故障类型,为法律智能体在生成前明确边界、执行中验证依据、输出前检查一致性等环节搭建可靠性防线提供支撑,并指出法律智能体的可信度不能仅由最终答案证明,需对全推理链路进行核验以阻断错误传播。