@yibie: Lexifina 的 Alan Yahya:调优 agent 行为,本质上是在对它手里的资源做升降级。看不见 agent 内部,就修不好它。 《看穿你的 agent 才能修好它》 See Inside Your Agents To Fix…

X AI KOLs Timeline 新闻

摘要

本文介绍 agent 可观测性与行为调优框架:通过提升或降级 agent 可访问的资源(工具、记忆、子代理)来调整其行为,并讨论性能、执行、用户对齐等视角和证据来源。来自 Lexifina 的 Alan Yahya。

Lexifina 的 Alan Yahya:调优 agent 行为,本质上是在对它手里的资源做升降级。看不见 agent 内部,就修不好它。 《看穿你的 agent 才能修好它》 See Inside Your Agents To Fix Them 行为调优——通过提升、延后或移除 agent 能访问的资源来调优它的行为。 | 资源 | 提升(Promoted) | 延后 / 广告(Deferred / advertised) | 移除 / 不可用(Demoted / unavailable) | |------|------------------|--------------------------------------|----------------------------------------| | 工具 | 完整 schema 放进模型上下文 | 只广告名字/命名空间;schema 按需加载 | 不暴露 | | 记忆 | 相关记忆注入/钉进工作上下文 | 只广告记忆索引/摘要;细节按需检索 | 不搜索、不注入 | | 子代理 | agent/交接直接暴露给模型 | 只广告轻量描述;委托时才实例化/加载 | 不作为委托目标暴露 | 降级(Demotion) • 隐藏:模型不知道它存在。 • 降秩:模型知道它存在,但另一个资源先赢。 • 门控:只有满足某个条件后才可用。 • 饿死:给它更少的 token、调用、时间或上下文预算。 • 限定范围:只暴露它能力或数据的一部分。 • 升级审批:另一个决策者、路由器、验证器或人类必须批准它的使用。 提升(Promotion) • 表面化:让模型知道这个资源以及什么时候用它。 • 排名:在选择时优先于同类资源。 • 预加载:在选择之前把它的 schema、指令或数据放进工作上下文。 • 路由到它:把匹配的任务发给它,而不是等模型自己选。 • 给预算:给它更多 token、调用、时间或上下文。 • 扩展:暴露更多能力、数据或范围。 • 许可:移除门控或提前授予权限。 • 持久化:让它在多轮、多请求或多会话之间保持可用。 视角(Lenses) 1. 性能:agent 在不同运行之间表现如何?按速度、成本和规模比较用户批准的结果。 2. 执行:这次运行为什么这么表现?检查模型调用(工具、委托)和上下文(压缩与检索)。 3. 用户对齐:agent 做了用户要求的事吗?分类意图并检查文档元数据和图表的改动。 证据 | 问题 | 证据 | |------|------| | 对话 | 整个旅程成功了吗?来源、请求、分支、最终结果 | | 请求 | 模型表现是否对齐?指令、父请求、时长、状态 | | 模型调用 | 模型收到并返回了什么?模型、上下文大小、缓存使用、延迟、输出 | | 工具调用 | 哪个动作跑了,跑通了吗?调用者、参数、结果、错误、重试 | | Agent 决定 | 什么改变了执行路径?行为调优:提升与降级 | | 制品 | 实际改了什么?文档、版本、精确 diff、审查状态 | 原文:https://lexifina.com/blog/see-inside-your-agents-to-fix-them… #Agent工程 #Agent可观测性
查看原文
查看缓存全文

缓存时间: 2026/08/07 22:57

Lexifina 的 Alan Yahya:调优 agent 行为,本质上是在对它手里的资源做升降级。看不见 agent 内部,就修不好它。

《看穿你的 agent 才能修好它》

See Inside Your Agents To Fix Them

行为调优——通过提升、延后或移除 agent 能访问的资源来调优它的行为。

资源提升(Promoted)延后 / 广告(Deferred / advertised)移除 / 不可用(Demoted / unavailable)
工具完整 schema 放进模型上下文只广告名字/命名空间;schema 按需加载不暴露
记忆相关记忆注入/钉进工作上下文只广告记忆索引/摘要;细节按需检索不搜索、不注入
子代理agent/交接直接暴露给模型只广告轻量描述;委托时才实例化/加载不作为委托目标暴露

降级(Demotion)

• 隐藏:模型不知道它存在。 • 降秩:模型知道它存在,但另一个资源先赢。 • 门控:只有满足某个条件后才可用。 • 饿死:给它更少的 token、调用、时间或上下文预算。 • 限定范围:只暴露它能力或数据的一部分。 • 升级审批:另一个决策者、路由器、验证器或人类必须批准它的使用。

提升(Promotion)

• 表面化:让模型知道这个资源以及什么时候用它。 • 排名:在选择时优先于同类资源。 • 预加载:在选择之前把它的 schema、指令或数据放进工作上下文。 • 路由到它:把匹配的任务发给它,而不是等模型自己选。 • 给预算:给它更多 token、调用、时间或上下文。 • 扩展:暴露更多能力、数据或范围。 • 许可:移除门控或提前授予权限。 • 持久化:让它在多轮、多请求或多会话之间保持可用。

视角(Lenses)

  1. 性能:agent 在不同运行之间表现如何?按速度、成本和规模比较用户批准的结果。
  2. 执行:这次运行为什么这么表现?检查模型调用(工具、委托)和上下文(压缩与检索)。
  3. 用户对齐:agent 做了用户要求的事吗?分类意图并检查文档元数据和图表的改动。

证据

问题证据
对话整个旅程成功了吗?来源、请求、分支、最终结果
请求模型表现是否对齐?指令、父请求、时长、状态
模型调用模型收到并返回了什么?模型、上下文大小、缓存使用、延迟、输出
工具调用哪个动作跑了,跑通了吗?调用者、参数、结果、错误、重试
Agent 决定什么改变了执行路径?行为调优:提升与降级
制品实际改了什么?文档、版本、精确 diff、审查状态

原文:https://lexifina.com/blog/see-inside-your-agents-to-fix-them… #Agent工程 #Agent可观测性


See inside your agents to fix them

Source: https://lexifina.com/blog/see-inside-your-agents-to-fix-them ConversationDid the full journey succeed?Origin, requests, branches, final outcomeRequestWas model performance aligned?Instruction, parent request, duration, statusModel callWhat did the model receive and return?Model, context size, cache use, latency, outputTool callWhat action ran, and did it work?Caller, arguments, result, error, retryAgent decisionWhat changed the execution path?Behavioural tuning:promotionanddemotionArtifactsWhat actually changed?Document, versions, exact diff, review state

相似文章

@knoYee_: https://x.com/knoYee_/status/2062780637677752366

X AI KOLs Timeline

作者复盘了使用多Agent协作三个月的经验,总结出五个主要痛点(如Agent间矛盾、忽略边界条件、自我审查失效、合并决策困难、压缩执行后暴露更难问题)和两个心得(只读审查Agent价值高、Agent矛盾暴露需求模糊),强调了人类在AI协作中的核心决策作用。

@SunNeverSetsX: 分享我珍藏的 4 个让 Agent Loop 跑得更快、更好的基础设施,一定要让你的 Agent 用上! 1. http://agent-browser.dev 让 Agent 在真实浏览器里点击、验证 UI 变更,实现真正的自闭环测试 …

X AI KOLs Timeline

agent-browser is a CLI tool for browser automation designed for AI agents, using compact text output and ref-based element selection to minimize token usage. The post also highlights three other tools—portless, emulate, and ai-cli—for improving agent loop efficiency.

@vintcessun: 原来agent安全可以不止盯工具调用,还能实时读它的推理过程。Adrian在agent执行动作前,既看行为日志又把reasoning chain过一遍,两个维度交叉检测。效果?DeepMind论文说联合分析比纯行为检查准确率提升35%。它…

X AI KOLs Timeline

Adrian 是一个开源 AI 代理运行时安全监控引擎,通过联合分析代理的行为日志和推理链进行异常检测,比纯行为检查准确率提升 35%,支持 LangChain 两行 SDK 接入。

@WWTLitee: 又是一个多 agent 协同工具:agency-agents 他可以直接把前端、社区、创意检查、现实校验这些角色分开跑,每个 agent 都有自己的边界、节奏和交付习惯,看起来更像一支小队在配合 仓库现在已经有 103.5k stars,…

X AI KOLs Timeline

Agency-Agents 是一个开源的 AI 多 agent 协作工具,集合了多个专业化角色(如前端、社区、创意检查等),每个 agent 有独立边界和交付习惯,适合构建多 agent 协作流程。GitHub 仓库已有 103.5k stars。