大模型法律引用审计争议
6 节点1 篇7 来源
大模型在法律领域的“幻觉”已从单纯的文本错误演变为系统性信任危机。最新研究显示,即便模型能正确引用法条,其判决逻辑往往并不依赖该法条,导致传统基于引用的合规审计失效;与此同时,美国法院中因AI伪造引证引发的制裁案件逐年激增,而中国学界则聚焦于政府审计场景中算法黑箱带来的责任归属困境。
【背景】在普通法系中,判例引用是论证基石;在中国行政体系中,审计报告具有法律效力。两者均要求极高的可验证性,但当前LLM的“概率生成”特性与法律的“确定性要求”存在结构性矛盾。
争议的核心在于:一方认为通过多智能体系统(如L-MARS, GANDR)和外部审计工具(如Wilson)可以修复引用链条,实现自动化合规;另一方指出,模型规模扩大并未显著降低幻觉率,且对抗性攻击极易绕过现有防御,单纯的技术修补无法解决根本的信任赤字。
未来需关注:1. 欧盟《人工智能法案》对高风险AI系统的透明度执行细则;2. 中国《审计法》修订中是否纳入AI辅助审计的责任界定条款;3. 主流法律科技平台是否强制集成第三方引用验证API。
事情怎么走到这一步
L-MARS系统发布,提出通过多轮法官循环提升严格引用F1分数,但指出检索增强生成(RAG)在提高准确率方面作用有限。
arxiv.org ↗LegalCiteBench基准测试显示,在无外部检索的闭卷设置下,最强模型精确恢复引用的得分低于7/100,误导性回答率超过94%。
arxiv.org ↗南京审计大学王宇航发表文章,分析生成式AI在政府审计中的数据合规风险与责任归属难题,呼吁建立分层透明度义务体系。
fcipub.org ↗普林斯顿大学研究发现,尽管有预测称新模型会减少幻觉,但含伪造引证的法庭文件数量仍在增长,GPT-5等最新模型在细微错误检测上仍表现挣扎。
arxiv.org ↗GANDR系统引入“起草者-批评者”双代理架构,通过逐声明审计将严格准确率提升至70.8%,显著优于基线模型。
arxiv.org ↗预印本《Cited but Not Consulted》揭示,LLM虽能正确命名法律依据,但改变依据时判决结果变化不一致,证明引用作为审计证据的价值存疑。
arxiv.org ↗