用500美元微调9B开源模型,在目录审核上超越前沿模型
摘要
一次仅花费500美元的RL微调,使9B开源模型在目录审核质量上达到87%,每1000条列表成本仅0.50美元,显著优于GPT-4和Claude等前沿模型(成本19-172美元,质量仅70-76%)。
暂无内容
查看缓存全文
缓存时间: 2026/07/28 06:28
# 智能所有权的崛起
来源:https://fermisense.com/when-machines-take-the-wheel/
## 目录完整性中的成本与质量
每千条列表的成本与质量散点图:前沿模型每千条成本为19至172美元,质量在70%至76%之间;微调的9B模型在每千条约50美分成本下达到87%的质量。
一图胜千言:在相同的目录审核工作流中,使用相同的工具、图像和评分器,我们对9B开源模型(粉色)的GRPO微调在每千条列表50美分的成本下,击败了我们测试的所有前沿配置:比最便宜的前沿方案便宜40倍,比最贵的便宜约340倍。
## 第一部分
### 每个人都在问同一个问题
自2022年ChatGPT推出以来,企业领导者一直在问同一个问题:*AI能为我们做什么?*答案始于低风险任务:总结文档、起草电子邮件、生成人类需要编辑的初稿。
它很快进入了更高价值的认知工作,例如软件开发和内容生成,并发展到更雄心勃勃的项目,例如尝试构建AI公司大脑(https://www.sentra.app/articles/what-is-a-company-brain),这是一个连接内部知识、数据和工具的系统,可以协调工作,最终自主运营部分业务。
尽管在AI采用上投入了大量时间、精力和算力,但可衡量的成果在大规模上几乎未能实现。然而,一些公司拥抱AI优先,在生产力、收入和成本方面获得了巨大收益,而另一些公司则落后或未能充分变革组织以实现高投资回报率。
来自企业费用管理平台Ramp的最新数据(https://x.com/eglyman/status/2036477278394138772)揭示了绩效的鲜明对比:2022年11月至2025年12月期间,AI投资最高的四分之一的公司收入增长了一倍多,而AI支出为零的企业的收入仅增长了15%。
#### 顶级AI采用者在各行业表现优异
顶级AI支出者(前四分之一)与AI支出为零的企业
同样的三年,同样的经济环境:在Ramp的客户数据中(https://x.com/eglyman/status/2036477278394138772),AI重度采用者的收入增长了一倍以上,而AI支出为零的企业增长了约15%(以2022年11月为基准=100;曲线根据报告端点绘制)。本文的其余部分将探讨AI重度群体实际做了什么。
AI为何为一些公司创造奇迹,而另一些公司却难以看到投资回报,原因有很多,但研究(https://mlq.ai/media/quarterly_decks/v0.1_State_of_AI_in_Business_2025_Report.pdf)主要指向五个方向。
#### 01 重新设计流程,而不仅仅是任务
成为AI优先意味着重新思考工作的结构,而不是简单地将模型放入以人为中心的工作流程中:哪些需要批准,谁审核什么,以及哪些交接仍然需要人类参与。如果流程保持不变,遗留的瓶颈会在生产率提升到达损益表之前将其吸收。在麦肯锡2025年对使用生成式AI的组织的调查中,工作流程重新设计是与EBIT影响(https://www.mckinsey.com/capabilities/quantumblack/our-insights/the-state-of-ai-how-organizations-are-rewiring-to-capture-value)相关性最高的属性,而只有21%的组织重新设计了至少一个工作流程。
#### 02 激励实验
模型、工具和最佳实践每周都在变化,因此上一季度的设置很少仍然是最合适的。只有在奖励人们尝试新事物并报告失败(而不仅仅是交付成果)时,这一点才能被注意到。技术团队是自然的起点,因为他们看到相同的问题在不同职能中出现,并能判断哪些问题模型实际上可以接手。
#### 03 提供定制的业务上下文
提示工程和检索可以在调用时注入业务上下文,但做好这一点本身就是一个工程计划:访问数据,对每个请求可以看到的内容实施访问控制,构建能够提取正确证据的检索,以及管理上下文窗口(https://www.anthropic.com/engineering/effective-context-engineering-for-ai-agents),而模型在窗口扩大时的使用并不均匀(https://arxiv.org/abs/2307.03172)。
#### 04 衡量使用情况和影响
每个AI项目最终都会遇到CFO的问题:这改变了什么?值得吗?在大多数部署中,没有人能回答这个问题:缺乏跟踪模型性能、决策成本或效率影响的基础设施,而且自我报告的时间节省通常不准确(https://metr.org/blog/2026-05-11-ai-usage-survey/)。如果没有在自有数据上进行评分评估,你能宣称的只是"感觉评估",这在预算上很难辩护。
在本文中,我们详细概述了优胜群体不断趋同的部署技术:使用强化学习微调开源模型。我们将介绍这如何解决上述最后三个挑战,以及如何将只有你的组织拥有的知识(即数据、工具和流程)转化为任何供应商API都无法匹敌且成本极低的模型。
### 关键要点
**2.2倍**:根据Ramp的数据,2022年11月至2025年12月期间,AI支出最高的四分之一公司的收入增长。AI支出为零的公司同期增长约15%,在同样的经济环境下:重度采用者的增长是其八倍。
**1**:优胜者趋同的剧本:开源模型、专有任务数据,以及针对评分版工作流的强化学习。Bridgewater训练好的模型比最佳前沿模型少犯约30%的错误,Harvey的法律代理在自身评估标准上优于GPT-5.5和Claude Opus 4.8,Intercom的Fin Apex以更低成本解决了更多支持问题。
**87.3%**:我们使用GRPO训练的9B开源模型在目录审核任务中达到的最大可得分数比例,而最佳前沿配置为76.9%:比前沿模型相对提高13.5%,比未经训练的基模型(64.2%)提高36%。五个前沿模型,即使使用优化提示,也彼此相差不到0.1分;训练出的专家模型突破了这一上限。
**68倍**:每条审核列表的成本优势:专家模型每千条0.50美元,而最强前沿模型为34美元,即使是最便宜的前沿选项也贵40倍。按每天约4000万次决策计算,这相当于每年约700万美元,而不是5亿美元,成本降低了98%。
## 第二部分
### 优胜者做了什么不同的事
大多数在AI竞赛中领先的公司都发现了同一件事:拥有自己的智能在性能和成本上都有优势。针对你特定环境中的特定工作流训练的模型,很有可能胜过从未进入过你公司内部的通用模型。此外,由于不需要在一个仅用于特定环境的模型中打包那么多通用能力,你通常可以使用更小的模型,运行成本低几个数量级。
拥有自己的智能并不意味着取消ChatGPT或Claude订阅。大多数工作流自动化仍然从前沿模型开始,这是正确的第一步:它建立了技术可能性的基线,每次调用都会产生数据(输入、决策、修正),专家模型随后在这些数据上进行训练。一旦自动化离开原型阶段,重点就转向了大规模下的成本和性能,这时强化学习微调开源模型就派上了用场。此外,你的"Fable 5"或ChatGPT模型可以调用专家模型来处理工作流中需要内部知识的部分,而专家模型也可以为需要高通用能力的任务调用前沿模型。
#### 模型如何学习在你的环境中运行
图示:任务发送到运行在你基础设施上的AI模型;模型与工具和数据交互,评估标准对结果进行评分,奖励信号更新模型。
模型与你的工具和数据交互,评估标准对结果进行评分,奖励信号更新模型。在数万个任务中重复,工作流的判断沉淀到权重中,而变化的事实(价格、库存、政策文本)则保留在工具中。
在过去两年中,这已经固化为一个剧本:开源模型、专有任务数据,以及针对评分版工作流的强化学习阶段。下面,我们讨论这种方法应用于实际任务的三个场景。
**Bridgewater Associates** 是全球最大的对冲基金之一。其分析师筛选源源不断的文章、文件和电子邮件,判断哪些文档与公司的投资论点相关,以及模板内容从何处开始。关键在于,"相关"意味着符合Bridgewater内部判断的相关性,而任何提示都无法让前沿模型可靠地吸收这种判断。因此,该公司决定使用其内部专家投资者的标签来训练一个开源模型。训练后的模型比最佳前沿模型少犯约30%的错误,而推理成本仅为其一小部分(https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/)。
**Harvey** 为律师事务所构建AI代理。其最困难的工作负载是长期任务:交易尽职调查和法律备忘录起草,代理需要处理大量文档集,错误会随着步骤累积,即使是最大推理努力下的最佳前沿模型也未能达到质量门槛。Harvey在一个开源模型上运行了强化学习,并获得了在法律评估标准上优于GPT-5.5和Claude Opus 4.8的法律代理(https://www.harvey.ai/blog/training-a-legal-agent-with-applied-compute)。
**Intercom** 是一个客户服务平台,其AI代理Fin每周解决近200万个客户问题。在这种规模下,问题是单位经济性:前沿模型的按次定价迅速累积,而每个百分点的解决率都至关重要。因此,Intercom的AI团队在数十亿客户服务交互上后期训练了自己的垂直支持模型Fin Apex。Intercom报告称,它解决了比最佳前沿模型更多的问题,同时运行成本更低(https://www.intercom.com/blog/announcing-fin-apex-the-age-of-vertical-models-is-here/)。
同样的模式远不止这三个案例。附录(https://fermisense.com/when-machines-take-the-wheel/#appendix)收集了另外八个部署,描述了每个模型被训练做什么以及部署后发生了什么变化。
一个部署模式在这些案例中反复出现:强化学习推动开源模型在特定工作流集合上超越前沿模型,每次调用的成本固定且大幅降低。部署通常从使用提示和上下文工程的前沿模型建立最强的默认基线开始。然后,这些前沿模型的轨迹和经验被重复利用,将专注的能力打包成一个公司拥有的紧凑模型。
## 第三部分
### 案例研究:目录完整性代理
运营电子商务平台的核心挑战之一是保持产品目录的可信度。每个列表必须归入平台分类法的正确类别,而驱动搜索、筛选、推荐和下游操作的属性必须从其图像和描述中准确提取。
**+15%**:我们微调的9B开源模型审核电子商务产品列表的准确率比我们测试的最佳前沿模型高15%。
**68倍**:使用微调模型替代前沿模型进行审核时,每条列表的成本降低68倍。
平台依靠目录完整性分析师团队来完成这项工作,该团队随着目录的增长而扩大:更多的列表意味着需要了解更多的类别,检查更多的属性,并判断更多模糊的边界案例。不一致的决策会扩散:产品更难找到,推荐系统退化,政策违规漏网。漏掉假货会使客户和品牌面临欺诈风险;过度标记则会产生昂贵的审核队列,令合法卖家感到沮丧。
让我们从规模开始。仅eBay就拥有约25亿条活跃列表(https://investors.ebayinc.com/fast-facts/default.aspx),而Shopify的目录每天吸收超过1000万次产品更新(https://shopify.engineering/leveraging-multimodal-llms)。沃尔玛曾表示,仅靠人工完成其AI辅助的目录工作需要大约100倍的人员(https://www.ciodive.com/news/walmart-generative-ai-data-experience/724426/)。
搞错会损失收入:71%的购物者表示他们曾因产品与列表不匹配而退货(https://www.salsify.com/resources/report/2025-consumer-research)。但审核本身也很昂贵。一个中等规模的市场每天约产生1000万次列表创建和编辑;如果使用前沿模型进行审核,该工作负载每年大约花费5亿美元,而微调专家模型则只需约1000万美元:
#### 同一工作负载,两种价格标签
前沿API按次调用 vs 微调专家模型自托管
两条柱之间的约50倍差距是整个价值主张的具体体现:在摄入规模下,前沿模型按次调用的架构不仅成本更高,而且直接超出预算。这正是为什么运行此工作流的公司并不在租用的模型上运行它。
实际运行此工作流的公司证实了这一计算。**Shopify** 使用微调的开源模型每天进行约4000万次产品分类推理(https://shopify.engineering/leveraging-multimodal-llms),并表示商业API无法经济地服务这一规模。受行业领导者启发,我们自己也运行了这个剧本:一个代理检查列表,搜索产品分类法,检查品牌,检索属性模式,并提交结构化决策,在证据不足或风险过高时升级到人工审核。
#### 一次完整的迭代过程
产品照片:黑色PU涂层工作手套
**列表**:工作手套,PU涂层,黑色,尺码10
**声称品牌**:AmazonBasics
**区域**:美国
1 `search_taxonomy` → 安全工作手套
2 `lookup_brand` → 已注册,不受保护
3 `get_attribute_schema` → 品牌、颜色、材质、尺码
✓ 提交类别、属性和判定 `allowed`
代理像分析师一样处理列表:找到正确的类别,验证声称的品牌,拉取该类别的属性模式,并提交其决策。干净的列表以批准结束;可疑的列表必须标记。模型学会不对称地权衡两种错误,因为漏掉真正的违规其代价是误报的7倍。
## 第四部分
### 模型可以练习的数字孪生
一个模型只能练习它能够实际执行、失败和重试的工作流。因此,我们将目录工作流重建为电子商务平台的数字孪生:一个模拟环境,具有与真实环境相同的列表、工具和风险。原始材料是Amazon Berkeley Objects(https://amazon-berkeley-objects.s3.amazonaws.com/index.html)数据集,包含真实产品图像和列表数据,我们将其转化为**177,767**个审核片段:每条列表一个片段,包含图像、标题、描述、声称品牌和区域。在该数据流中,我们植入了受控的政策案例、不匹配的图像、冲突的品牌声明,以及故意的合法声明作为难负样本,这样每个片段都有已知的正确答案用于评分。
在数字孪生内部,模型
相似文章
@LangChain: 微调开源模型可以超越或匹配前沿模型。基础 @Alibaba_Qwen 开箱即有良好的提示能力:强…
使用LoRA微调像阿里巴巴Qwen这样的开源模型,可以在错误分类任务上匹配或超越前沿模型性能。
你需要一个前沿模型作为引用验证器吗?——针对深度研究来源归因的评估LLM基准测试
本文对8个用于深度研究系统中引用质量的LLM评估器进行了基准测试,发现较便宜的模型在来源相关性和事实支持方面仍与前沿模型竞争,但在方向偏差上有所不同,这对强化学习训练很重要。
@eglyman: 微调开源模型一直难以证明其合理性。为什么要投资调优一个模型,而更好的模型在一个月内就会发布?……
Ethan Glyman 宣布,他的团队开发了一种方法,能够以极低的成本在开源模型之间迁移微调结果,使得微调更加经济合理。
以100倍更便宜的开源模型在检索任务上击败GPT-5.6 Sol
Neon与Castform合作展示了如何将RL后训练的开源权重模型与Lakebase Search相结合,以100倍更低的成本和延迟,在检索任务上击败GPT-5.6 Sol等前沿模型。
使用开源模型构建了价格仅为 CodeRabbit 六分之一的替代方案
使用开源模型构建了比 CodeRabbit 更便宜的替代方案,以六分之一的成本实现了相似或更好的 PR 审查准确性,并具备自动修复和基于提示的 bug 修复等功能。