标签
Harvey集成GPT-6 Astra以增强AI驱动的法律文件起草,为律师事务所提供更具语境感和结构化的输出。
IntLawNER 是一个新的用于国际法的命名实体识别数据集和基准,涵盖了来自法律文本的金标准标注句子,并评估了模型在少样本改进方面的性能。
本文提出了一种针对LLM生成的合同条款的风险敏感评估框架,重点关注法律失效模式和质量维度,以评估超出准确性或流畅性的风险。
Grok 4.7在法律工作和终端任务方面显示出显著改进,在Harvey Legal Agent Benchmark和Terminal-Bench 4.0等基准测试中超越竞争对手,同时保持代币价格不变。
Vals AI 对 Grok 4.7 进行了评估,发现其在 Vals 指数中排名第 24,得分 54.2%,较 Grok 4.6 下降,但在法律和医疗领域显示改进。
本文介绍了PIJ基准测试,用于评估大型语言模型在基于不完整证据的犯罪剖析任务中的表现,重点突出了推理任务中的性能差距和偏见。
一位用户比较了ChatGPT和Gemini,发现Gemini在提供准确的法律推理和承认逻辑缺陷方面更胜一筹,而ChatGPT则依赖循环论证并回避直接回答。
这篇立场论文主张,法律大语言模型的幻觉应被视为法律依据的缺失而非事实性错误,并提出一个新的基准框架来评估法律人工智能系统。
本文引入LexAgentHallu,一个用于剖析法律AI智能体中幻觉的层次化基准测试,通过细粒度指标评估多步轨迹。
本文介绍了LexIssue,这是一个用于识别中文民事诉讼中争议法律问题的基准测试,基于真实案例和专家标注构建,并展示了检索增强生成能够提升性能。
本文介绍了OBJECTION,一个推理时流水线,使用对抗性律师代理来缓解法律判决预测模型中的有罪偏见,展示了错误有罪率的显著降低,并发布了一个新的'Natural Innocent'数据集。
本文对比了Bloomberg和Thomson Reuters在AI模型开发上的不同策略,分析了从零训练大模型到在开放基座上微调的转变,以及这一趋势对垂直领域AI应用的影响。
Harvey是一家OpenAI支持的法律科技公司,已转而使用Moonshot AI的Kimi K3开源权重模型来开发其首款内部模型Harvey Tenet,这标志着西方科技向中国开源权重AI系统的转变。
Harvey 分享在预算有限的情况下通过领域专家指导合成数据、建立评测集、与实验室合作及使用模型路由等技术实现世界级 AI 研究的策略。
介绍了ContractScrub,一个用于评估大语言模型在法律合同清理任务中表现的基准,揭示当前前沿模型在此领域特定挑战上表现不佳。
Tenet AI系统在公司法任务中表现出优越的性能,在多个维度上超越了Opus5和Fable。
Harvey 后期训练了 Kimi K3 模型以创建 Harvey Tenet,用于长期法律工作,在法律基准测试中取得了更好的性能并提高了成本效率。
Vector Legal 是一家面向创业公司和风险资本的AI原生律所,使用 LangSmith 进行代理部署和车队管理,以支持其法律工作流程,并最近完成了一轮融资。
汤森路透推出了下一代CoCounsel Legal,这是一款AI驱动的产品,整合了法律研究、起草和工作流,与Westlaw和Practical Law集成,包括Westlaw Brief Builder用于自动化起草,同时保持律师的控制权。