@ArizePhoenix: Phoenix's agent PXI can propose annotation categories, annotate traces en mass, and even suggest fixes based on pattern…
摘要
介绍如何使用 Phoenix 的 Pixie 助手自动对错误跨度进行分类、批量标注,并基于失败模式生成系统提示修复建议。
查看缓存全文
缓存时间: 2026/07/14 08:20
Phoenix’s agent PXI can propose annotation categories, annotate traces en mass, and even suggest fixes based on patterns of failures. Learn how to do it:
https://t.co/6eQUMchZKz
TL;DR: 使用 Phoenix 的 Pixie 助手对购物代理的 17 个错误跨度进行分类、批量标注,并基于观察生成系统提示修复建议。
识别与过滤错误跨度
上一集我们总共发现了约 11 个错误跨度,但并非所有错误都值得立即修复——速率限制、数据库宕机、空值检查等许多问题不在可控范围内。需要先用状态码错误宏过滤出所有错误跨度,再进一步分析来源。
切换到“全部”视图后,嵌套的错误也显示出来,最终我们得到 17 个跨度。
让 Pixie 分析错误并提出分类建议
点击 Phoenix 中的 Pixie 胶囊图标,向它发送指令:“Pixie,看看所有错误跨度,分析哪里出了问题,并给出一些分类建议。” Pixie 会自动从根跨度切换到“全部”视图,并提供详细的观察日志。
观察结果包括:
- Chroma DB 连接被拒绝
- API 速率限制(多次出现)
- 无效工具调用(两次)
- 价格问题(三次)
- 空产品数据(出现次数最多)——搜索项目或获取产品崩溃时产生
- LLM 错误(三个)
- 工具超时、无效工具、基础设施故障等
细化分类粒度:从“空产品数据”拆分为更细的类别
空产品数据 这个标签太宽泛,不符合“是或否”的分类原则。好的分类应该像“这只猫是不是白色”一样明确,而不是“猫是什么颜色”这种开放式问题。
再次询问 Pixie:“我觉得至少有一个类别太宽泛了,你能再细分一下吗?” Pixie 建议 工具超时 是最可拆分的类别,并将部分归为 提示注入。实际分析发现:智能体正确拒绝了提示注入,但仍然因真正的购买产品服务超时而报错。最终决定拆分为“工具超时”和“提示注入”,确认后提交。
批量标注 17 个错误跨度
Pixie 询问是否需要继续用这些新类别标注所有 17 个跨度。选择“继续标注这些跨度”。在设置中可切换到“绕过批准”,这样 Pixie 无需每次确认即可自动执行批量标注操作。
标注结果显示在跨度列表中,每个跨度被标记为对应的错误类别(例如:空产品数据、速率限制等)。
逐个检查标注的跨度
1. Chroma DB 宕机(基础设施故障)
不在控制范围内。添加备注:这是基础设施问题,不是提示词或我们能控制的事情,提交 bug。
2. 注入尝试
智能体正确执行了职责——模型拒绝透露系统提示。这不是 bug,而是功能。
3. 工具购买产品超时(30000 毫秒)
应提交 bug。
4. 无效工具调用:购买零个物品
查看对话记录,发现 LLM 以为可以接受数量为零,但实际上不允许。这属于可修复的问题。
用 Pixie 分析跨度并生成修复提示
从跟踪跨度中读取当前的系统提示,询问 LLM:“如果仔细看,它就在这里。Pixie 现在正在查看我们识别出的所有不同问题,并提出一个新的系统提示。” Pixie 分析后提出修订后的系统提示,内容如下:
这是一个 Wonder Toys 购物代理,目的是帮助用户购买玩具。可以使用搜索产品或购买产品工具,但只有当客户明确要求购买时才调用购买产品。不允许传递零数量。
这是一个很好的示范:使用 LLM 识别不同跟踪中的问题,并基于模式自动建议修复方法。但要注意:推荐的修复只是一个假设,直到实际测量、评分和加权后才能确认效果。下一集将采用这个提示,并实际验证它是否能减少错误跨度中的错误数量。
相似文章
@ArizePhoenix: Phoenix has an agent built into it now! PXI can help you find the crucial traces you should actually be reading. Short …
Phoenix 内置了 Pixie 智能助手,能帮助用户快速筛选出智能体 span 出错但模型回复正常的静默失败 trace,大幅提升 trace 阅读效率。
PhoenixRepair:重新思考软件代理中的修复策略探索
PhoenixRepair 是一个多智能体框架,系统性地探索多个候选编辑位置,并对补丁生成进行迭代反思和优化。在 MiniMax-M2.5 模型上,它在 SWE-bench-Verified 上达到了 76.0% 的 Pass@1 率,并在 DeepSeek-V3.1 模型上相比 SWE-agent 取得了 7.8% 的相对提升,达到了最先进水平。
@ArizePhoenix: 本周 Phoenix 动态 - 反馈变得更可见,智能体能力更强:PXI 子智能体的服务端 bash(…
本周 Phoenix 更新为 PXI 子智能体增加了服务端 bash,支持沙盒执行和内置 GraphQL 访问,提升了反馈可见性和智能体能力。
@ArizePhoenix:调试智能体时,必须迅速定位问题!Phoenix 新增对话列表-详情快速导航…
Arize Phoenix 新增对话列表-详情快速导航与可调整抽屉,助力更快调试智能体对话,同时会话已支持 VIM。
@ArizePhoenix: 跟踪级注释无处不在 - 跟踪分数现在作为同级列出现在跟踪标题中(位于状态、成本…旁边)
Arize Phoenix 宣布跟踪级注释现在作为同级列显示在跟踪标题中,并在项目统计面板中作为独立部分,同时在流式传输期间实时更新。