rd-signal-2:生产规模下的前沿分类(7分钟阅读)

TLDR AI 模型

摘要

Raindrop推出由rd-signal-2驱动的Signals 2.0,这是一个从生产轨迹构建任务特定二元分类器的新模型管道。它声称在成本降低1600倍的情况下,实现了接近GPT-5.6 Sol xhigh的准确率,同时还推出了Signal Builder,用于构建自定义分类器,且零数据保留。

Raindrop推出Signals 2.0,提供由rd-signal-2模型驱动的任务特定二元分类器,以极低的成本达到接近GPT-5.6的准确率。
查看原文
查看缓存全文

缓存时间: 2026/08/12 20:20

# rd-signal-2:生产规模下的前沿分类 来源:https://www.raindrop.ai/blog/signals-2-frontier-classification/ 今天,我们正式发布 Signals 2.0,其底层由 **rd-signal-2** 驱动——这是我们全新的模型流水线,用于基于生产轨迹构建任务特定的二分类器。 **rd-signal-2** 在准确率上接近 **GPT-5.6 Sol xhigh**,而成本却低 **1600 倍**;相比 **GPT-5.6 Luna xhigh** 则低 **260 倍**。 该模型即日起向所有 Raindrop 客户开放(无需额外费用)。 我们还发布了 **Signal Builder**(https://cal.com/team/raindrop-ai/chat-15-min):一个用于训练和托管自定义分类器的平台,支持零数据保留。Signal Builder 将 Signals 的能力带入了最严格的环境(包括医疗健康领域)。 ## 一切都是二分类问题 去年,OpenAI 发表了一篇题为《语言模型为什么会幻觉》(https://arxiv.org/abs/2509.04664)的论文。他们说,幻觉本质上是一个二分类问题:任何陈述要么为真,要么不为真。 LinkedIn 的头条立刻得意起来:“OpenAI 解决了幻觉问题。” 而且,如果“二元性”能让分类变得简单,他们确实做到了。但事实证明,生活中的一切也都是二分类:你该结婚或不该结婚;UI 要么好要么不好。 ……而某个智能体行为,要么好,要么不好。 二分类是一个艰难的对齐问题。你需要先在公司内部对齐人类对“好/坏”的定义,然后探索所有边界情况,再然后——只有在这之后——你才能让一个模型或流水线与这个定义对齐。 Raindrop 覆盖了为智能体行为训练精准分类器的完整旅程。 ## 面向智能体的分类器 2025 年 6 月,我们发布了第一版 Signals(https://x.com/benhylak/status/1935794106493722702):一个用于训练微型分类模型的自动化流水线。 当时,我们的分类器针对给定行为评估一对输入/输出。这在聊天机器人时代是可行的,因为相关证据都包含在单轮对话中。我们的竞争对手至今仍受此限制。 但现在,智能体的失败往往跨越多个轮次、工具调用和子智能体,有时甚至涉及数十万个 token。这些失败通常是微妙且稀疏的。要发现它们,既需要确定性的过滤来整合相关证据,也需要语义判断来解读这些证据。 对每条轨迹都运行前沿模型是最显而易见的方案,但除其他问题外,在生产规模下它会变得极其昂贵和缓慢。 较小的模型价格可承受,但它们难以处理复杂行为,且常常受限于上下文长度。 **rd-signal-2** 通过一个自动化的研究循环解决了这个问题。针对每种行为,它研究生产轨迹,编写代码来组装关键上下文,并利用该上下文训练一个任务特定的模型。 ## rd-signal-2 如何构建 Signals 当智能体产生以下轨迹时: ``` 智能体轨迹 · 4 个事件 · 90.2 秒 1 update_record({ id: 42, status: "resolved" }) · 超时 · 30.0 秒 2 update_record({ id: 42, status: "resolved" }) · 超时 · 30.0 秒 3 update_record({ id: 42, status: "resolved" }) · 超时 · 30.1 秒 最终回复 “记录已成功更新。” rd-signal-2 · 在多次失败后声称成功 · 匹配 ``` 失败并不包含在任何一个步骤中。它是重复的工具失败与助手最终回复之间的关系。**rd-signal-2** 可以表达这种关系: 代码会找到相关的工具调用,比较它们的输入,并检查它们是否失败。如果这些条件不满足,Signal 会在不调用模型的情况下返回“不匹配”。 如果条件满足,Signal 会从轨迹中提取失败的尝试和助手的最终回复。剩余的语义判断则交给一个“任务特定分类头”与我们的内部语义推理模型(针对二分类优化)的组合。 这是一个简单的例子,且仅限于单轮。Signals 的设计目标是高效、动态地收集来自跨越数天甚至数周会话中的上下文。 ## 在构建时推理 **rd-signal-2** 将“构建”分类器所需的推理与“执行”分类器所需的计算分离开来。 传统的 LLM 评判器浪费推理 token,反复发现同样的证据,并每次做出略微不同的判断。 **rd-signal-2** 支付一次性成本,可以分摊到未来每一条轨迹上: 通过迭代并执行严格的自我验证,系统可以尝试多种方案,直到找到与客户意图相匹配的那一个。 **模型调用应随不确定性增长,而不是随流量增长。** 因此,Signals 的成本足够低,可以包含在 Raindrop 平台中,并每月在数十亿条轨迹上运行。这与 Braintrust 和 Langchain 等平台形成鲜明对比——后者要求客户自掏腰包支付推理费用。 ## 二分类是一个对齐问题 构建有效分类器最难的部分,往往是弄清用户的真实意图。我们很快意识到,这既是一个机器学习问题,也是一个产品问题。 回到重复工具调用的例子。Signal 是否应该匹配,如果: - 参数略有变化,但策略没有变? - 前三次尝试失败,但第四次成功? - 智能体承认操作失败? - 智能体将任务交给了已完成该任务的子智能体? 每一个决策都植根于我们客户的判断。将客户细致入微的需求转化为一个忠实的分类器,是一个不小的产品问题。 ### 各策略解释下的匹配率 宽松的身份匹配:4.6% 严格匹配:3.1% 限流豁免:1.4% 最终成功豁免:0.9% 67% 的匹配轨迹至少被一种解释匹配,同时被另一种解释排除。 为了说明找到这条界线有多难,我们针对同一句行为描述写了四个变体,并将它们全部运行在同样的 2000 条生产轨迹上。匹配率从 0.9% 到 4.6% 不等,67% 的匹配轨迹至少被一个变体所争议。人机对齐将继续是 Raindrop 的一个活跃研究领域。 ## 一个 Signal 永远没有真正的完成 构建一个准确的分类器只是第一步。Raindrop 会持续帮助它保持准确。 随着模型和框架的变化,轨迹的形态也会变化。客户在看到 Signal 处理更多数据时,也会发现规格错误。一个 Signal 即使代码不变,也可能变得不那么准确。 部署之后,我们会持续监控。每天我们会用前沿模型随机抽样生产环境中的 Signals。当这些评估发现漂移或回归时,我们会重新运行提示优化并重新调参。 这就形成了一个持续循环: 持续的重新评估使 Signal 在模型和轨迹分布漂移时依然保持对齐。 我们还赋予客户自行调优的全部能力。他们可以直接检查和修改驱动 Signal 的代码与提示词。 ## 在生产规模下安全运行 Signals 评估 10,000 条轨迹很容易。每天运行超过 200 万条,则需要谨慎的模型服务、队列、重试和隔离。 默认情况下,每个生成的 Signal 都被视为不可信。每个客户的 Signals 都在隔离的环境中运行,没有凭据或互联网出口。一个组织的运行时只能访问该组织的数据。 轨迹上下文只获取一次,并缓存在评估工作节点附近,因此多个 Signals 可以复用,而无需重复执行昂贵的查询。这保证了热路径专注于确定性执行,以及少数需要模型判断的情况。 在生产规模下,中位轨迹的分类时间为 100 毫秒。该基础设施目前每月评估超过 200 亿条轨迹。 ## rd-signal-2 如何构建更好的 Raindrop **rd-signal-2** 已经不仅仅驱动 Raindrop 中的用户自定义分类器。 我们的问题检测系统共享同一架构,用于识别、跟踪和监控客户数据分布中新出现的失败模式。这使得我们的客户可以即时将检测到的任何问题转化为长期运行的 Signal。在此基础上,他们可以优化策略,使用 Experiments 进行 A/B 测试,以及更多操作。 Signals 可以由用户创建,通过我们的 Triage Agent 构建,由你的编码智能体通过 MCP 生成,或者被 Raindrop Issue Detection 等系统使用。 一旦部署,它们都会经过相同的评估和监控基础设施。 使用编码智能体创建 Signal 使用编码智能体创建 Signal ## Signals 2.0 API Signals 不仅限于 Raindrop 平台。开发者现在可以直接调用 Signals API,将领域特定的检测能力构建到自己的系统中。 对于有更严格数据要求的团队,ZDR Signals 支持在保留生产数据的前提下,训练和运行任务特定的分类器。 ## 试用 Signals 2.0 Signals 2.0 即日起在 Raindrop 中可用。 在 Raindrop 中创建你的第一个 Signal:立即开始(https://app.raindrop.ai/signup),或与我们的团队预约通话(https://cal.com/team/raindrop-ai/chat-15-min),一起构建一个。

相似文章

Ring-2.6-1T 在真实世界智能体任务中达到 SOTA 水平

Reddit r/ArtificialInteligence

蚂蚁集团发布了 Ring-2.6-1T,这是一个拥有 1 万亿参数的推理模型,专为智能体工作流设计,采用 MIT 许可证、扩展上下文,并使用了异步强化学习 (Async RL) 和 IcePop 训练方法,取得了最先进的成果。