@rohanpaul_ai:在他们的官方博客上阅读更多。
摘要
Not Diamond 宣布推出 Not Diamond Code,这是一款面向编码代理的智能模型路由器,可根据每个步骤选择最佳模型和推理工作量,声称可节省 20% 以上的成本,并在编码基准测试中实现帕累托最优性能。
查看缓存全文
缓存时间: 2026/08/05 00:19
阅读他们的官方博客以了解更多信息。
https://t.co/BvRjF0BTaE
Not Diamond Code:面向编码智能体的智能模型路由
来源:https://www.notdiamond.ai/blog/not-diamond-code-intelligent-model-routing-for-coding-agents Not Diamond Code:面向编码智能体的智能模型路由 今天我们宣布推出 Not Diamond Code——我们专为长周期编码智能体打造的智能模型路由器。Not Diamond Code 可与任何网关和智能体框架(包括 Claude Code)集成,在智能体会话的每一步自动选择成本最低且最合适的模型,在不降低任何质量的前提下将成本降低 20% 以上。
在过去的六个月里,随着个人开发者和企业纷纷采用长时间运行、高度并行的智能体工作负载,推理支出急剧增加。智能模型路由使团队能够持续受益于模型格局中快速提升的能力、效率和多样性,从而实现比任何单一模型都更低的成本和更高的质量。
Not Diamond Code 基于一种新颖的路由技术,该技术通过预测在智能体序列的每一步中,给定模型和推理努力程度所带来的未来奖励与成本来做出推荐。推荐以缓存感知的方式做出,针对长轨迹结果进行优化,并根据开发者反馈信号实时持续更新。我们在前沿编码智能体基准测试的帕累托前沿上实现了最优性能,并且在我们的企业早期访问计划中,在提升开发者体验和满意度的同时,实现了 20% 以上的成本节省。
基准性能
我们在 Poly-SWE-bench(一个面向 GitHub 问题的多语言仓库级基准测试)和 LongCodeQA(一个基于真实世界仓库的长上下文代码理解基准测试)上对 Not Diamond Code 进行了评估。我们使用 Claude Code 作为框架,在 Haiku 4.5、Sonnet 4.6 和 Opus 4.8 之间以不同推理努力程度进行路由。我们将 Not Diamond 的路由器性能与固定的 Anthropic 模型及推理努力配置进行了比较,比较指标包括任务完成率和每次任务的推理成本。
散点图,比较了 Poly-SWE-bench 上的模型路由质量和成本。Not Diamond Code 出现在帕累托前沿上,以显著更低的成本实现了接近 Opus 4.8 XHigh 的性能。在 Poly-SWE-Bench Verified 上,Not Diamond Code 接近 Opus 4.8 Xhigh 的性能,同时将推理成本降低了 39%散点图,比较了 LongCodeQA 上的模型路由质量和成本。Not Diamond Code 达到了帕累托前沿,以低于固定高端模型配置的推理成本提供了前沿级别的代码理解性能。在 LongCodeQA 上,Not Diamond Code 接近 Opus 4.8 Xhigh 的性能,同时将推理成本降低了 61%Not Diamond Code 在两个基准测试中均实现了帕累托最优性能,通过将编码智能体会话中的每一轮路由到最合适的模型和推理努力程度,在降低成本 39-61% 的同时,接近 Opus 4.8 Xhigh 的质量。
我们还评估了在闭源和开源模型的混合组合之间进行路由,具体来说是在 Poly-SWE-Bench 上使用 Haiku 4.5、Sonnet 4.6、Opus 4.8、GLM 5.2 和 DeepSeek V4 Flash。我们表明,将开放权重模型引入路由池可将性能提高 3.6%,并将成本节省从 39% 提高到 66%。
散点图,比较了在 SWE-PolyBench 上使用 Anthropic 和开源模型时的路由性能和成本。添加 GLM 5.2 和 DeepSeek V4 Flash 可提高性能,并相比仅使用 Anthropic 路由增加成本节省。在闭源和开源模型之间进行路由,使 Poly-SWE_Bench 性能提高了 3.6%,并将成本节省从 39% 提高到 66%。虽然在单一提供商内部进行路由可以实现显著的成本节省,但最大的机会在于跨多个提供商以及闭源和开源模型之间进行路由。这不仅能为团队最大化性能和成本节省,还能保护他们免受供应商锁定,并确保他们始终能从模型格局的改进中受益。
Not Diamond Code 的工作原理
编码智能体工作负载涉及许多用户和子智能体轮次,而最佳模型选择在会话过程中可能会发生变化。在每一轮之前,Not Diamond 会考虑当前和之前的会话状态、消息和令牌数量、任务复杂度、隐式开发者反馈信号以及 KV 缓存的状态,来模拟给定模型和推理努力程度推荐的未来成本与未来奖励。然后,我们的路由器选择模型,以优化整个会话的质量和成本结果,而不仅仅是下一个请求的质量和成本。
Not Diamond 具有缓存感知能力,并会考虑在缓存仍然温暖时于会话中途切换模型的成本。因此,即使一个更便宜的模型能够处理某一特定轮次,Not Diamond 也可能继续使用更昂贵的模型以保持缓存温暖;或者当更强大的模型可能更有效或更高效地完成工作时,它也可能打破缓存以升级到该模型。相反,当上下文窗口利用率较低或缓存较冷时,Not Diamond 会优先考虑路由经济性而不是缓存经济性。
架构图,显示 Not Diamond Code 作为本地代理与编码智能体框架一起运行。代理将派生元数据发送到 Not Diamond 优化服务,接收模型路由推荐,并通过用户现有的网关或提供商路由请求。Not Diamond Code 通过隐私保护的本地代理路由编码智能体请求Not Diamond Code 通过隐私保护的本地代理与开发者的编码框架一起运行。代理从智能体负载中收集匿名化的派生元数据,并将这些元数据传递给 Not Diamond 优化服务,该服务将模型和推理努力程度推荐返回给本地代理。然后,请求直接从用户的机器通过其现有的网关或提供商执行,这使 Not Diamond 成为唯一一个与框架和网关无关的智能模型路由器。此外,这种架构使 Not Diamond 能够仅使用派生元数据以隐私保护的方式进行路由,而无需让智能体负载、输入或输出离开开发者的本地机器。
对于开发者来说,他们使用 Not Diamond Code 的体验与正常使用其框架时完全相同,路由决策在后台自动进行。Not Diamond Code 还会根据每位开发者的隐式反馈信号随时间调整,持续改进,以针对每位开发者的工作负载和偏好个性化路由决策。
一个演示,左侧是 Not Diamond 使用 Claude Code 路由请求,右侧是本地路由日志
构建多模型未来
我们创立 Not Diamond 的目标是为多模型未来构建路由基础设施。一个拥有多种多样模型的世界,比每个人都为所有事情使用单一巨型模型的世界更具性能优势和成本效益。智能模型路由促进了多元化的提供商市场,将权力重心从实验室转移到消费者,并减少了人工智能的生态影响。最终,我们相信模型路由不仅有助于在各种通用模型之间进行选择,还有助于在日益专业化的中小型模型之间进行路由。
2023 年 12 月,我们发布了全球首款开源智能模型路由器,此后我们一直在解决这个问题。模型路由既是一个非常困难的问题,也是一个不断变化的目标。对于长周期编码智能体来说,相互依赖的变量和模型选择的下游后果使这个问题更具挑战性。随着绝大多数推理支出转向智能体工作负载,为每个 AI 产品和消费者提供有效、可靠且安全的路由基础设施比以往任何时候都更加重要。
Not Diamond Code 正被领先的初创公司和财富 500 强工程团队使用,以在实现前沿输出质量和开发者体验的同时减少推理支出。在我们的早期访问计划中,与 Opus 4.8 相比,我们看到了超过 20% 的成本节省和 33% 的开发者体验指标提升。Not Diamond 专为企业部署而设计,具备 SOC 2 合规性和 ISO 27001 认证、隐私保护路由、与框架和网关无关的集成、细粒度的成本和节省仪表板,以及管理员级别的访问和安全控制。
申请早期访问
我们正在有选择地让团队加入 Not Diamond Code 早期访问计划。开发者和团队可以在自己的编码智能体工作流上测试 Not Diamond,并将路由与他们当前的默认模型策略进行比较。在此处申请访问权限(https://www.notion.so/361c0792ca6e804d993cd2142641c883?pvs=21),或与我们的团队预约时间(https://calendly.com/not-diamond-gtm/intro-from-nd-code-launch-blogpost)。
相似文章
@julien_c: 模型路由是多模型堆栈中缺失的一层。开源模型在编码方面不断进步,路由帮助它们…
Not Diamond Code 是一款面向长期编码代理的智能模型路由器,为每一步选择最佳模型和推理努力,可将成本降低 20-65%。
@rohanpaul_ai: Not Diamond 刚刚发布了他们模型路由的方法论,该方法论在降低代理成本的同时获得了 Opus 级别的高质量……
Not Diamond 发布了一种模型路由的方法论,该方法论在将代理成本降低 20-80% 的同时,实现了 Opus 级别的质量,使用序列决策方法有效处理长时间运行的编码代理。
@mckaywrigley:看好模型路由器。相同性能更低成本是显而易见的,但通过创建“更平滑”…
一条推文强调了模型路由器和“模型融合”的前景,提到Not Diamond Code的发布,这是一种面向编码智能体的智能模型路由器,可将成本降低20-65%。
@DeRonin_: https://x.com/DeRonin_/status/2054235707791778034
一份实用指南,介绍了如何通过更智能的 Token 管理(包括多模型路由、提示词缓存和上下文纪律)来降低 80% 的 AI 编码成本,而不是简单地切换到更便宜的模型。
在测试了本地大语言模型、OpenRouter 以及市面上所有的付费方案之后……我找到了成本效益最高的编程智能体配置方案。
该文章介绍了一种通过将Claude Code接入DeepSeek API来实现低成本AI编程代理的方案,该方案利用提示词缓存技术显著降低token消耗成本,同时保持高水平的推理能力。