标签
本立场论文提出了TRISM框架,该框架将神经符号AI与LLMs和RAG相结合,以解决法律AI中的幻觉和可解释性问题,引入了RASOR RAG用于生成可解释的理由,并形式化了符号化法律知识库。
法律 AI 初创公司 Sandstone 获得 3000 万美元 A 轮融资,旨在为内部法律团队构建 AI 驱动的工作流自动化平台,专注于为中小型企业路由、分类和执行法律任务。
作者介绍了GLAW,这是一个用于法律和政府任务的自主多代理AI系统,涉及研究、分析、起草和执行,并邀请讨论其风险与保障措施。
Parthenon 是一个自进化的法律智能体框架,将 LLM 智能体组织为六个可审计层,并通过防数据泄漏的学习循环机制,在不修改模型权重的前提下提升端到端法律事务处理性能。基于 Harvey LAB 的大规模实证研究涵盖 12,510 条智能体轨迹,结果表明当前前沿智能体在严格事务完成度方面仍面临较大挑战,而 Parthenon 相比现有最优基线方法取得了显著提升。
讨论路由和后训练开源模型如何在准确性、速度和成本上超越前沿模型。Harvey与Fireworks AI的合作表明,混合法律代理在质量和成本上均优于前沿模型。
本文介绍了DAR(Deontic Agentic Reasoning),一个智能体框架,使LLM能够交互式地查询法律法规和政策,用于法律/监管推理任务。在DeonticBench上评估的结果表明,智能体引导可以提升前沿模型,但可能会导致较弱模型在数值任务上表现下降,同时消耗更多令牌。
斯坦福法学院的一项研究发现,在盲评中,法学教授更喜欢AI生成的答案,而不是由同事教师撰写的答案,AI在直接对决中赢得了75%的胜率,这表明AI有潜力改变法律教育。
Kirkland & Ellis 计划在四年内投入5亿美元(其中今年1亿美元)构建自己的内部AI法律工具,很可能是为了应对Harvey AI平台。
介绍了CanLegalRAGBench,这是一个基于真实查询和专家标注答案来评估加拿大判例法上检索增强生成的基准。评估显示对设计选择敏感、开源嵌入模型具有竞争力,以及生成答案中持续存在的幻觉问题。
Marc Andreessen认为法律AI是一个非常鼓舞人心的应用,因为它让非专业人士能够在法庭和官僚机构中挑战体制。这是对Jeff Huber声称法律AI是最不具启发性的AI用例的回应。
N2I-RAG是一个结合自适应检索、LLM智能体和验证的框架,用于从规范性文本中计算法律指标,注重透明度和可追溯性。它在法国海洋环境法语料库上优于基线。
本文介绍了一套用于法律AI的相关性敏感评估套件,表明LLM对法律无关的扰动过于敏感,并提出LexGuard,一个基于形式推理的对抗性多代理框架,以提高法律推理的可靠性。
介绍RTI-Bench,这是一个用于分析印度《信息权法》下决策的结构化数据集,对NLP和法律人工智能研究具有实用价值。
本文系统性地探索了轻量级(<2B)大语言模型在刑事法院观点生成中的能力,研究了模型架构、规模与对罪名预测影响之间的权衡。作者还介绍了CVGEvalKit,一个包含三个公开数据集的评估框架。
本文指出了人工智能法律推理中法律解释与形式逻辑之间的系统性鸿沟,提出了一种神经符号方法来弥合这一鸿沟,并展示了在严格形式蕴含条件下重新标注法律自然语言推理数据时出现的显著标签偏移。
介绍了一种用于法律对话中主动信息提取的探究型对话代理(ICA),提出了一个双层次强化学习框架,该框架学习何时以及如何提出探测性问题,并在美国最高法院口头辩论数据上进行评估。
法律科技公司 Clio 实现 5 亿美元年度经常性收入(ARR),同时 Anthropic 扩展其法律 AI 功能,凸显 LLM 在法律领域的日益普及。
This article introduces Magis-Bench, a benchmark for evaluating large language models on magistrate-level legal tasks such as judicial reasoning and sentence drafting, using data from Brazilian judicial exams.
Report claims that GPT-5.5 Instant shows significant improvements in factual accuracy, particularly in high-stakes fields like medicine, law, and finance.
本文详细阐述了法律 AI 系统在生产环境中面临的三种常见故障模式:将所有来源视为同等可信、无法处理相互矛盾的法律观点,以及缺乏特定律所的内部知识。文章提出了诸如权威性加权、分歧检测以及注释层等解决方案,以建立系统的可信度与实用性。