标签
本文提出在法律基准测试中联合自动审计答案正确性与法律权威依据的 grounding,结果表明在普通提示词下,LLM 经常给出正确答案却引用错误的适用法条。
文章讨论了 Hugging Face 的一个实验:一个自动循环仅重写冻结模型周围的代码(工具层),在不改变模型权重的情况下,将其基准分数从 0% 提升到接近 Sonnet 4.6 的水平,且成本更低。这证明许多基准测试失败源于工具层,而非模型本身。
Harvey与Applied Compute合作训练了一个法律智能体,对智能体堆栈进行了优化,并使用来自其法律智能体基准(LAB)的奖励信号对GLM-5.1模型进行了后训练。
TW-LegalBench 是一个评估大型语言模型在台湾法律理解能力方面的基准,包含超过16,000道选择题、117道论述题和14,000个法律判决预测实例。结果显示,顶级模型超过了律师考试及格线,但未达到法官和检察官的水平,凸显了在法律文本生成可靠性方面的挑战。
研究者发布首个公开基准 LegalBench-BR,用于评估大模型在巴西法律文本分类任务上的表现。实验表明,LoRA 微调的 BERTimbau 大幅超越 GPT-4o mini 与 Claude 3.5 Haiku。
Harvey AI 发布了 Harvey LAB,这是一个用于评估 LLM 智能体在真实法律工作中表现的开源基准,包含覆盖 24+ 个业务领域的 1,671 个任务数据集及一个执行框架。