@ArizePhoenix: 你可以直接使用PXI在Phoenix上运行实验!这里有一个测试系统提示与schema感知提示的实验…
摘要
Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。
你可以直接使用PXI在Phoenix上运行实验!这里有一个实验,使用相同模型测试系统提示与schema感知提示,由代码评估器评分——当检查是程序化时,无需LLM评审员。
TIL:“当一个评估在所有地方都失败时,先怀疑评估本身。” https://t.co/5X5Yw9oGFR
查看缓存全文
缓存时间: 2026/07/27 15:56
您可以直接使用PXI从Phoenix运行实验!这里有一个测试系统提示与模式感知提示的对比,使用相同模型,由代码评估器评分——当检查是程序化时,无需LLM评判。
TIL:“当评估全部失败时,先怀疑评估本身。” https://t.co/5X5Yw9oGFR
相似文章
@ArizePhoenix: PXI(Phoenix Intelligence)现可在终端中运行!您现在无需离开终端即可使用PXI。这与…
PXI(Phoenix Intelligence),这款AI代理此前仅可在浏览器中使用,现可通过CLI包@arizeai/phoenix-cli在终端中作为交互式聊天使用。
@ArizePhoenix: 本周 Phoenix 动态 - 反馈变得更可见,智能体能力更强:PXI 子智能体的服务端 bash(…
本周 Phoenix 更新为 PXI 子智能体增加了服务端 bash,支持沙盒执行和内置 GraphQL 访问,提升了反馈可见性和智能体能力。
@ArizePhoenix: Phoenix has an agent built into it now! PXI can help you find the crucial traces you should actually be reading. Short …
Phoenix 内置了 Pixie 智能助手,能帮助用户快速筛选出智能体 span 出错但模型回复正常的静默失败 trace,大幅提升 trace 阅读效率。
@ArizePhoenix: 实验基准化与图表 当试图判断新模型是否胜任时,需要考虑很多…
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。
@ArizePhoenix: 机器学习中最古老的教训之一,对于使用 LLM 应用仍然非常有用:不要用相同的数据进行评估……
本文讨论了使用 Arize Phoenix 开发 LLM 应用的最佳实践,特别强调了使用训练集/验证集/测试集拆分来进行诚实评估和追踪回归的重要性。