Show HN:Morph Reflexes – 用于智能体轨迹的多头分类器

Hacker News Top 工具

摘要

Morph Reflexes 利用共享主干上的多头分类器,从智能体轨迹中提供快速、廉价的语义信号,实现对生产智能体的可扩展监控。

生产智能体最常见的故障是行为层面的:循环、推理泄露、用户挫败感等。使用 GPT 或 Sonnet 等前沿模型对每个回合进行判断,在大规模运行时成本过高且速度过慢。<p>为了解决这个问题,我们构建了 Reflexes:从智能体轨迹中提取语义信号,通过 API 快速廉价地提供。基于自定义内核和从 vLLM 分叉的自定义推理引擎构建。<p>在底层,它是一个围绕多头推理设计的小型 LLM。小型模型需要针对特定任务进行训练,但在同一输入上为 50 个任务运行 50 个独立的模型毫无意义。<p>工作原理: 我们使用具有混合注意力的现代 LLM,并移除了解码步骤。我们构建了一个推理引擎,使得预填充计算在反射之间能够 99% 重用,类似于 2019 年左右的 BERT/HYDRA 和更早的多头技术。我们构建推理引擎以跨输入重用 KV/缓存,并跨所有反射共享计算。一个共享主干读取一次轨迹,然后多个头分类不同的信号。我们的推理引擎跨所有反射重用相同的 KV/缓存和计算,使得每次额外反射的推理时间小于 30ms,开销低于 0.1%。<p>我们采用了同样的高层思路,并努力使其与现代架构和注意力机制兼容。在此基础上,我们可以在 30ms 内完成推理,并在 90ms 内提供完整请求。无论是运行 4 个反射还是 100 个,额外开销都小于 2ms。<p>为什么优化这一点很重要?<p>即使你是一个中等规模的初创公司,也要处理数万次智能体运行和数百万次回合。如果你想追踪用户挫败率随时间的变化,前沿大模型评判方法无法扩展。<p>我在特斯拉构建了类似的技术栈。当机器学习工程师需要从 PB 级数据中采样信号(如 `is_camera_obfuscated=true` 以及其他 200 个信号)时,你需要:1)快速启动它们;2)高效大规模运行。<p>这不是什么: 一个仪表盘。99% 的仪表盘无人使用。 100% 以 API 为先,专为希望以此触发自己功能的开发者设计。<p>在我们的仪表盘中训练一个自定义反射,和/或让它在生产环境中自我改进:<a href="https://www.morphllm.com/dashboard/reflex">https://www.morphllm.com/dashboard/reflex</a><p>文档:<a href="https://docs.morphllm.com/sdk/components/reflexes/index">https://docs.morphllm.com/sdk/components/reflexes/index</a><p>我欢迎来自运行生产智能体人员的反馈:你们希望跨 100% 的回合长期追踪什么,但目前无法做到?<p>TLDR:从智能体轨迹中提取语义信号,通过 API 快速、廉价地提供。
查看原文
查看缓存全文

缓存时间: 2026/07/04 12:40

# Show HN: Morph Reflexes – 用于智能体轨迹的多头分类器 来源:https://news.ycombinator.com/item?id=48739038 生产环境中智能体最常见的失败是行为性的:循环、推理泄露、用户沮丧等等。使用像GPT或Sonnet这样的前沿模型来评判每一轮对话,成本太高且速度太慢,无法大规模运行。 为了解决这个问题,我们构建了Reflexes:从智能体轨迹中提取语义信号,通过API快速、廉价地提供服务。构建在自定义内核和从vLLM分支出来的自定义推理引擎之上。 本质上,它是一个围绕多头推理设计的小型LLM。小型模型需要针对特定任务进行训练,但在同一输入上为50个任务分别运行50个小模型是没有意义的。 工作原理:我们使用具有混合注意力的现代LLM,并移除了解码步骤。我们构建的推理引擎使得预填充计算在不同reflex之间可以99%重用,这类似于2019年左右的BERT/HYDRA和更早的多头技术。我们构建的推理引擎跨输入复用KV/缓存,并在所有reflex之间共享计算。一个共享的骨干网络读取一次轨迹,然后多个头部分类不同的信号。我们的推理引擎跨所有reflex复用相同的KV/缓存和计算,从而实现了低于30ms的推理,每个额外reflex的开销不到0.1%。 我们采用了相同的高级思路,并付出了艰苦努力,使其适用于现代架构和注意力机制。在此基础上,我们可以将推理时间控制在30ms以内,完整请求的服务时间控制在90ms以内。无论你运行4个reflex还是100个,额外开销都小于2ms。 为什么优化这一点很重要? 即使你是一个中等规模的初创公司,你也要处理数万次智能体运行和数百万次对话轮次。如果你想随时间追踪诸如用户沮丧率等指标,前沿LLM作为裁判是不可扩展的。 我在特斯拉时构建了类似的技术栈。当机器学习工程师需要从PB级数据中采样信号,比如`is_camera_obfuscated=true`,以及200多个其他信号时,你需要1) 快速启动它们 2) 高效地大规模运行 它不是什么:一个仪表盘。99%的仪表盘都没人用。100%优先API,专为希望用它来触发自己任务的开发者设计。 在我们的仪表盘中训练自定义reflex,和/或让其在生产环境中自我改进:https://www.morphllm.com/dashboard/reflex 文档:https://docs.morphllm.com/sdk/components/reflexes/index 我非常希望收到来自运行生产环境智能体的人的反馈:有哪些事情是你希望能在100%的对话轮次中随时间追踪,但目前还做不到的? TLDR:从智能体轨迹中提取语义信号,超快,通过API廉价提供。

相似文章

多头注意力残差

Hugging Face Daily Papers

介绍了多头注意力残差(MHAR),它将路由查询重塑为逐子空间头,使每个特征子空间通过自己的 softmax 读取深度历史。在基于 Nemotron 的语料库上从头训练,MHAR 在 100M 到 1B 规模上相比标准 Transformer 持续改善验证损失,并提升训练中期的下游准确率。