@gabepereyra: https://x.com/gabepereyra/status/2090453918547685537
摘要
Harvey 推出了 Tenet,这是一个基于 Kimi K3 后训练的 AI 模型,专为长期法律任务设计,在基准测试中表现出改进的性能和成本效率。
查看缓存全文
缓存时间: 2026/08/21 17:14
后训练研究进展更新
作者:@nikogrupen @ItsJulioPereyra @calvincongelado @vtrengarajan @gabepereyra
过去六个月,Harvey的研究议程聚焦于两大目标:
-
利用开源权重模型构建前沿法律智能系统;以及
-
创建允许律师事务所构建专属模型并自主管理其知识产权的系统。
今天,我们分享这项研究的最新进展,包括首个后训练模型的初步成果。我们将其命名为 Tenet。Tenet 基于 Kimi K3 模型,我们与 Fireworks Research 合作进行了针对长期法律任务的专项训练,并通过优化改进提升了训练效率与任务执行能力。初步研究显示,该模型在性能与成本效益方面均取得显著突破。
模型性能
本次训练的核心目标是增强模型处理长期、智能体式法律任务的能力。通过在合成数据、公开法律数据及人类专家数据的混合语料上进行后训练,模型在 LAB 持出任务上的表现显著提升。相较于基线 Kimi K3,我们的模型在 LAB 任务中成功完成的持出任务数量近乎翻倍,在 LAB 合同任务中提升 20%,全通过率分别提高 9 个和 2 个百分点。这种提升体现在答案细节与引用规范等广泛维度,类似于我们在 NVIDIA Nemotron 等模型中观察到的进步。该模型在 LAB 合同任务中达到顶尖水平,在 LAB 总榜中位列第二。
法律基准测试的全面表现。(附录中包含更多基准数据)
法律基准测试的全面表现。(附录中包含更多基准数据)
这些改进在其他领先智能体基准测试中同样有效,包括 Mercor 的 APEX Agents(公司法)和 Crosby 的 Redline Bench。在我们的模型未在训练中见过这些基准测试的情况下,其表现大幅超越 K3 基线,这表明模型所学行为能跨基准、跨训练框架稳健迁移。
模型在法律知识类基准测试中也保持优异表现,例如 Mercor 的 APEX-v1、Scale 专业推理基准测试,以及 LegalBench、CUAD、MAUD 等法律知识测试。这证明智能体能力的提升并未影响模型对教科书式法律概念的基础理解能力。
基准测试的完整详情请参见附录。
成本效益
第二个重要发现是成本优化。开源模型的后训练为降低模型成本提供了双重机会:首先是开源权重模型本身具有更低的单 token 价格;更重要的是,成本由单 token 价格与实际 token 消耗量共同决定。在后训练过程中,我们通过奖励塑形机制鼓励高效工具使用与推理策略,优先选择能在同等性能下减少推理时 token 消耗的训练轨迹。这使我们能够同时优化成本与质量——在保持成本稳定的前提下实现性能大幅提升。
图 1:LAB 持出任务的质量-成本帕累托前沿。基线得分来源:Vals LAB 排行榜。
图 1:LAB 持出任务的质量-成本帕累托前沿。基线得分来源:Vals LAB 排行榜。
数据,尤其是人类专家数据,是我们后训练工作的关键要素。我们与 Mercor 等伙伴紧密合作,构建并扩展人类专家数据集,对合成数据进行审查与修正,使得如此规模的训练得以实现。
下文将详细阐述我们的训练与评估方法,并介绍通过研究开发的、将逐步整合至 Harvey 产品的额外能力。
训练方法
以 Kimi K3 为基础模型,我们与 Fireworks 合作,通过异步强化学习(RL)在真实法律工作环境中进行模型后训练。训练过程中,智能体接收长期法律任务,根据其高效生成实质性法律工作成果的能力进行评分。
训练环境与法律智能体基准测试(LAB)任务共享结构。每个环境包含:
-
以律所合伙人工作请求形式撰写的任务指令;
-
包含相关文档与材料的客户事务包;以及
-
阐明高质量工作成果应包含核心要点的专家评分标准。
每次训练展开时,智能体在沙盒工作空间中初始化,载入任务相关的客户事务文件,并配备搜索事务包、阅读文档、起草工作成果所需的工具。完成工作后,智能体将最终成果写入磁盘,即结束当前回合。
每个展开通过“LLM-as-a-judge”机制依据任务评分标准进行评估。奖励定义为细粒度标准满足比例项与全局性法律问题解决数量项的加权和,并为所有标准满分的展开提供额外奖励。我们通过消融实验对比了候选裁判模型与更强前沿模型在评分上的表现,最终确定 Kimi 2.6 为质量与效率最优的裁判模型。
我们采用分组序列策略优化(GSPO)优化智能体策略。针对每个训练任务,我们采样一组独立展开,用上述评分标准进行评分,计算组内优势值(经组内方差归一化)。对分数接近的组重新评分以减少梯度噪声,同时引入组内长度惩罚项鼓励简洁成果。通过序列平均重要性权重对 token 进行加权,确保训练稳定高效。此外,我们实施双侧剪枝并屏蔽高重要性比率 token,防止强化学习崩溃。
更多训练细节请参见附录。所有后训练过程均未使用任何客户数据。
能力拓展
除核心法律任务执行外,我们还探索了在标准智能体训练框架之外扩展模型能力的途径。这些能力独立训练,可作为工具或子智能体被模型调用以处理特定任务。
本节概述以下方向的初步成果:
-
并购尽职调查:在 RLM 训练框架下进行后训练,使模型能有效协调并购尽职调查等大规模长期任务。
-
审阅表格:提升模型在大批量文档审阅与结构化数据提取中的效率与效能。
-
律所知识库:训练模型通过记忆与涌现的结构化分类法理解律所知识体系,实现更高质量、更高效的检索。
每项能力均在特定任务数据集上训练与评估。下文将分别介绍数据集、当前成果及其在推动法律智能体发展方面的潜力。
并购尽职调查
在并购尽职调查等复杂文档密集型任务中,后训练带来显著收益。在 LAB 尽职调查任务中,单个任务需处理最多 8000 万 token 的文档上下文以识别风险并生成尽调报告。当前前沿模型与通用编程智能体在此场景下均表现不佳,基线模型在 LAB 尽职调查任务中的评分标准通过率均未超过 43.8%。
图 2:不同模型、训练框架与配置在 LAB 尽职调查任务中的平均标准通过率。RLM 行对比了同一 GLM-5.2 根模型在自蒸馏 SFT 前后的表现。
图 2:不同模型、训练框架与配置在 LAB 尽职调查任务中的平均标准通过率。RLM 行对比了同一 GLM-5.2 根模型在自蒸馏 SFT 前后的表现。
提升此类专业任务智能体性能的关键,在于采用具备领域适配基础组件的智能体框架进行后训练。我们与 Baseten Research 合作,将智能体框架扩展至支持递归语言模型(RLM)。在 RLM 架构中,根智能体在 REPL 环境中管理任务文档库,可进行编程式检索与切片,并将研究与分析任务委派给拥有独立上下文窗口的子智能体。仅采用 RLM 框架搭配 GLM-5.2 调度器,即可将标准通过率提升至 46.1%。在此框架内,基于高覆盖轨迹的自蒸馏后训练进一步将通过率提升至 60.1%,主要解决了基础模型在文档库审阅中过度分配任务的问题。
这些是初步研究成果,我们将在后续技术报告中提供更多细节。
审阅表格
在 Harvey 审阅表格等大批量文档分析任务中,后训练同样带来显著提升。审阅表格支持用户对最多 10,000 份文档进行结构化数据提取与分析,要求模型输出结构清晰、引用准确的结果。
图 3:审阅表格产品界面示例,展示已填写单元格、推理过程与引用来源。
图 3:审阅表格产品界面示例,展示已填写单元格、推理过程与引用来源。
我们与 Applied Compute 合作,针对前沿模型在代表性审阅表格任务中的能力缺口,构建了包含合成数据与公开数据的语料库。基于此语料库对 GLM-5.2 模型进行结构化数据提取与分析的专项训练,并通过奖励塑形机制鼓励生成格式规范、简洁准确且引用详实的答案。与最强基线相比,经后训练的模型答案质量提升 3.6 分,引用质量提升 12.1 分,且单单元格成本降至约十分之一,推动了质量-成本帕累托前沿。在强化学习后训练过程中,模型习得了实用行为,例如当问题不适用某文档时保持沉默,提供精确证据支持而非冗余引用。
图 4:各模型答案质量与引用质量对比(0-1分制)。实线黑色:经训练的 GLM-5.2(我们的模型);空心:GLM 5.2 基础模型。坐标轴截取自观测范围。
图 4:各模型答案质量与引用质量对比(0-1分制)。实线黑色:经训练的 GLM-5.2(我们的模型);空心:GLM 5.2 基础模型。坐标轴截取自观测范围。
我们认为这些提升源于直接在审阅表格生产环境中训练的能力——模型在训练过程中学会了如何处理检索上下文、模式约束与引用规范。完整详情请参阅我们的博客文章。
律所知识库
在搜索与推理律所积累知识的智能体后训练中,我们同样取得了可喜进展。在 LAB 律所知识库任务中,完成先例检索任务需要对约 1 亿 token 的合成客户事务进行推理。由于缺乏对律所的了解,基础模型默认采用重复性全面搜索,每次查询都重新阅读整个工作空间。
为此,我们与 Engram 合作,训练了将律所知识编码至参数记忆与结构化文本笔记的 Qwen3.8-27B 模型。训练过程中,智能体探索律所知识库,将特征整合为 100 万 token 的结构化知识,并通过自生成数据的蒸馏与强化学习将语料库内化至模型权重。
图 5:学习投入与推理投入对比。平均标准得分与查询平均推理 token 数的关系。实线:Harvey 在不同学习投入下的表现;虚线:Opus 4.8 在不同推理投入下的表现。增加学习投入可在减少查询 token 消耗的同时提升质量;增加推理投入会导致 token 使用量上升但收益递减。
图 5:学习投入与推理投入对比。平均标准得分与查询平均推理 token 数的关系。实线:Harvey 在不同学习投入下的表现;虚线:Opus 4.8 在不同推理投入下的表现。增加学习投入可在减少查询 token 消耗的同时提升质量;增加推理投入会导致 token 使用量上升但收益递减。
该方法显著提升了模型高效识别相关律所知识的能力,标准通过率提升超过 15%,任务完成率提高近 10%。记忆机制还带来更精准的检索,将完成轨迹中的总 token 消耗降低 58%。综合来看,经后训练的模型在识别相关案件与完成任务方面与领先前沿模型竞争力相当,同时将查询成本降低 90%。
图 6:各模型在不同投入设置下的 token 效率(每 10 万推理 token 的平均标准得分)。实线黑色:Harvey 在不同学习投入下的表现;空线:未经学习的 Qwen3.8-27B;灰色:前沿模型在不同推理投入下的表现。
图 6:各模型在不同投入设置下的 token 效率(每 10 万推理 token 的平均标准得分)。实线黑色:Harvey 在不同学习投入下的表现;空线:未经学习的 Qwen3.8-27B;灰色:前沿模型在不同推理投入下的表现。
此外,模型的每 token 智能密度(即智能体每 10 万推理 token 成功完成的评分标准平均分数)提升三倍。我们的模型在每 token 智能指标中得分 190.8,而最佳前沿配置为 129.3,同等规模模型仅 37.2。高效的 token 使用轨迹不仅速度更快、成本更低,还能避免无关信息污染智能体上下文窗口,从而在处理大规模上下文时提供更准确、精准的答案。
完整详情请参阅 Engram 的博客文章。
后续计划
Tenet 及其扩展能力是我们环境设计、后训练与开源权重模型研究的重要里程碑。它证明即使在最复杂的法律任务中,针对性的环境训练也能提升模型能力,并与创新研究相结合,可解锁构建更高效法律智能体的全新方法。
接下来,我们将扩展 LAB 的司法管辖区、业务领域与工作流覆盖范围,以帮助理解和提升智能体在多样化法律工作中的表现。同时,我们正加大算力投入,将研究转化为 Harvey 产品中的新通用模型与能力。
LAB 与后训练展现了优化专业服务智能体的潜力,我们期待为客户实现这一愿景。
致谢
本项工作离不开众多团队与合作伙伴的支持。特别感谢 Fireworks、Engram、Baseten、Applied Compute、NVIDIA、Mercor 和 Snorkel AI 在模型与环境构建方面的合作,以及 Spencer Poff、Nick Gillies 和 Karl de la Roche 对项目的贡献。同时感谢 Harvey 内部的 Assistant、AI 平台、审阅表格与安全部门团队,助力研究成果向产品转化。
附录
此处详细说明环境设计、训练与评估方法论。
环境设计
我们的模型在类似 LAB 的智能体法律环境中训练,并在法律基准测试中评估。每个任务构建为封闭式客户事务包。指令简短(平均约 50 词),以律所合伙人工作请求形式撰写而非详细输出规范。事务文件包含核心与边缘文档,法律问题分散嵌入于多个文件中,因此智能体必须从模糊指令出发,在事务包内建立上下文,并基于该上下文生成可供审阅的工作成果。
每个任务的专家评分标准将合伙人级评审要点分解为细粒度评估项…
相似文章
Harvey 后期训练 Kimi K3 以进行长期法律工作 (阅读需10分钟)
Harvey 后期训练了 Kimi K3 模型以创建 Harvey Tenet,用于长期法律工作,在法律基准测试中取得了更好的性能并提高了成本效率。
OpenAI支持的法律科技公司转向中国Kimi K3开源权重模型
Harvey是一家OpenAI支持的法律科技公司,已转而使用Moonshot AI的Kimi K3开源权重模型来开发其首款内部模型Harvey Tenet,这标志着西方科技向中国开源权重AI系统的转变。
Kimi K3: 开放前沿智能
Kimi 推出 Kimi K3,一个拥有 2.8 万亿参数的开放模型,具备原生视觉和 100 万上下文能力,基于 Kimi Delta Attention 和 Attention Residuals 构建。它在编码与推理方面达到前沿性能水平,完整权重将于 2026 年 7 月前发布。
@tenstorrent: 感谢东京!以下是我们在TT-Deploy Japan上宣布的所有内容:更快的AI推理 • Kimi K2.6 900 t/s/u,速度提升3倍…
Tenstorrent在TT-Deploy Japan上宣布,其硬件上对Kimi K2.6、LTX 2.3和DeepSeek-R1实现了更快的AI推理,此外还推出了可授权的TT-Ascalon S RISC-V CPU,用于生成式AI代理应用。
@levie: k3 模型权重已到达
Kimi.ai 发布了 Kimi K3 的模型权重和技术报告,这是一个 2.8T 参数的 MoE 模型,具有原生视觉理解和 1M token 上下文窗口,声称每单位计算智能提升 2.5 倍。