@ArizePhoenix: 你可以直接使用PXI在Phoenix上运行实验!这里有一个测试系统提示与schema感知提示的实验…
摘要
Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。
你可以直接使用PXI在Phoenix上运行实验!这里有一个实验,使用相同模型测试系统提示与schema感知提示,由代码评估器评分——当检查是程序化时,无需LLM评审员。
TIL:“当一个评估在所有地方都失败时,先怀疑评估本身。” https://t.co/5X5Yw9oGFR
查看缓存全文
缓存时间: 2026/07/27 15:56
您可以直接使用PXI从Phoenix运行实验!这里有一个测试系统提示与模式感知提示的对比,使用相同模型,由代码评估器评分——当检查是程序化时,无需LLM评判。
TIL:“当评估全部失败时,先怀疑评估本身。” https://t.co/5X5Yw9oGFR
相似文章
@ArizePhoenix: PXI(Phoenix Intelligence)现可在终端中运行!您现在无需离开终端即可使用PXI。这与…
PXI(Phoenix Intelligence),这款AI代理此前仅可在浏览器中使用,现可通过CLI包@arizeai/phoenix-cli在终端中作为交互式聊天使用。
ArizePhoenix: 本周我们让从问题到答案更快。• 更智能的PXI工作流现在通过JavaScript沙箱运行多步骤UI任务,助手可代码控制UI。
Arize通过集成JavaScript沙箱增强PXI工作流,实现多步骤UI任务自动化,使助手能通过代码控制用户界面,从而获得更快的结果。
@ArizePhoenix: 本周 Phoenix 动态 - 反馈变得更可见,智能体能力更强:PXI 子智能体的服务端 bash(…
本周 Phoenix 更新为 PXI 子智能体增加了服务端 bash,支持沙盒执行和内置 GraphQL 访问,提升了反馈可见性和智能体能力。
@ArizePhoenix: Phoenix has an agent built into it now! PXI can help you find the crucial traces you should actually be reading. Short …
Phoenix 内置了 Pixie 智能助手,能帮助用户快速筛选出智能体 span 出错但模型回复正常的静默失败 trace,大幅提升 trace 阅读效率。
@ArizePhoenix: 实验基准化与图表 当试图判断新模型是否胜任时,需要考虑很多…
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。