如果你的智能体架构是 LLM → 工具 → 动作,那你就是用 API 密钥造了一门自信大炮。

Reddit r/AI_Agents 新闻

摘要

一篇议论文,认为典型的基于 LLM 的智能体流水线(LLM → 工具 → 动作)缺乏适当的不确定性处理,并提出一种带有贝叶斯更新和信息价值策略的信念状态架构。LLM 应充当调查员/翻译者,而系统负责执行权限和校准信念。

暴论:大多数“智能体”系统并不是智能体。它们只是一个穿着工具腰带的语言模型,从“感觉”直接走到副作用。 用户请求 → LLM 说“可能是 X” → 调用工具 → 发生不可逆的事情 这不是不确定性下的推理。这是带着上了膛的 Nerf 枪在自动补全。有时它是一把真枪。 缺失的层是概率,但不是那种“模型说有 92% 置信度”的角色扮演版本。我指的是一个将这些分开的架构: 现实 = 实际为真的东西 观察 = 日志、文档、工具输出、用户输入 信念 = 当前证据所支持的东西 行动 = 系统被允许做的事情 LLM 在这个系统内很有用。它能阅读非结构化痕迹、提出假设、重新表述检索查询、选择候选探针,并解释最终结果。它不应当同时担任法官、陪审团、计算器和生产部署按钮。 这是我希望能出现在更多智能体架构图中的架构: 原始请求 / 痕迹 / 文档 → 解析器 + LLM 解释 → 类型化证据记录 → 关于隐藏原因的信念状态 → 贝叶斯更新 → 来自 LLM + 工具的候选探针 → 信息价值 / 成本 / 权限策略 → 行动 / 询问 / 搁置 / 升级 → 结果记录、校准、漂移监控 这些数学不是学术装饰 假设一条生产痕迹失败了。真正的根因是隐藏的。可能的原因有: - 工具载荷格式错误 - 上游依赖超时 - 检索上下文溢出 - 权限失败 智能体应持有一个信念分布:P(原因 | 证据) 一条新线索出现:模式验证失败。更新信念:后验 ∝ 似然 × 先验 P(H | E) ∝ P(E | H) × P(H) LLM 可以说:“模式不匹配看起来有道理。” 可以。那是一个假设。系统仍需追问: 在这个服务中,模式失败有多常见?在每一个相互竞争的原因下,这条线索的可能性有多大?输入证据可信吗?如果这个假设是错的,允许采取什么行动? 因为: P(线索 | 原因) ≠ P(原因 | 线索) 是的,那句老掉牙的贝叶斯公式依然靠毁掉糟糕的演示为生。 人们跳过的那部分:每种不确定性都有不同的形状 不是每个未知都能被称为“置信度”。 | 智能体问题 | 有用的模型 | |---|---| | “这条证据足够吗?” | 伯努利分布 | 一个是/否事件 | “哪个根因是活跃的?” | 分类分布 | 多个相互竞争的原因 | “500 个案例中有多少个需要审查?” | 二项分布 | 固定批次,是的结果计数 | “这一小时到达多少事件?” | 泊松分布 | 随时间的到达计数 | “审阅者会在 15 分钟内响应吗?” | 指数分布或生存模型 | 等待时间风险 | “这个传感器读数异常吗?” | 高斯分布或经验基线 | 连续测量 这不是分布收集行为。它会改变决策。 例子: P(审阅者在 15 分钟内完成) = 18% 及时审阅的收益 = ₹12,000 等待 + 审阅的成本 = ₹3,000 净价值 = 0.18 × ₹12,000 - ₹3,000 = -₹840 正确的做法:立即搁置这个有风险的动作。走紧急升级路径。不要坐在那里等待一个人形奇迹。 信息增益也还不够 一个探针可以减少不确定性,但仍然具有零操作价值。如果每个可能的探针结果都仍然迫使“搁置”,那么这个探针可能在智力上令人满足,但在操作上毫无意义。 真正的问题是信息价值:这些证据是否足以改善最终决策,从而证明其成本是合理的? 成本包括:金钱、延迟、算力、隐私、权限、人类注意力、机会成本。 因此策略是:当预期决策改进 > 探针的全部成本时才去获取。当没有任何被允许的探针值得购买时,就停下来。 LLM 的实际角色 LLM: - 解释混乱的文本 - 提出假设 - 生成候选探针 - 综合证据 - 解释结果清单 系统: - 验证结构 - 维护校准的信念 - 执行权限 - 计算风险/成本/截止日期的权衡 - 选择并执行允许的动作 - 从确认的结果中学习 LLM 是调查员和翻译。架构的其余部分则是监管链、计算器和安全官。 如果你的智能体唯一的安全机制是:“小心一点。” 恭喜你。你为一只随机鹦鹉写了一幅励志海报。 构建信念状态。为不确定性分类。为下一个问题定价。执行策略。记录结果。这样,你就拥有了一个值得在生产环境附近信任的智能体。
查看原文

相似文章

你的LLM不应该是你的编码智能体工作流

Reddit r/openclaw

主张在编码智能体工作流中,LLM应仅用于推理,而由确定性基础设施处理队列、状态、重试和恢复,这样即使达到使用限制,流程也不会中断。