标签
Phoenix 现在支持 Meta 的 Muse Spark 1.3,这款模型与其他模型一起悄然发布,它值得比实际获得的更多关注。
ArizePhoenix 发布了一个更新,自动搜索重复项,草拟带有链接 traces 和 spans 的 GitHub 问题,并使用安全的浏览器端 GitHub 令牌进行提交。
本文详细介绍了使用 Arize Phoenix 和 OpenTelemetry 为 LangChain 应用实现成本和令牌可观测性的方法,重点区分 LLM 工具调用、工具执行和最终响应,以避免指标混淆。
ArizePhoenix在Terminal-Bench 4.0和Humanity's Last Exam等基准测试中表现出显著的性能提升,较之前的版本如Fable 5有显著进步。
Arize Phoenix 为 AG2、Together AI、Cohere 和 Ollama 发布了四个新的插桩器,扩展了其 AI 可观测性和追踪集成。
Arize Phoenix 宣布推出代理追踪的可定制可视化功能,可在生产环境中实时跟踪缓存命中、在线评估性能下降和工具调用错误。
Arize Phoenix 宣布为其AI代理监控平台新增定制功能,包括可定制图表、命令K、最近搜索以及自定义列排序。
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。
PXI(Phoenix Intelligence),这款AI代理此前仅可在浏览器中使用,现可通过CLI包@arizeai/phoenix-cli在终端中作为交互式聊天使用。
本周 Phoenix 更新为 PXI 子智能体增加了服务端 bash,支持沙盒执行和内置 GraphQL 访问,提升了反馈可见性和智能体能力。
Arize Phoenix 宣布 PXI 的实验性功能,可派生子代理,从而在长时间调查中保持主上下文窗口的精简。
Arize Phoenix 为代码智能体提供本地优先、离线隔离的可观测性,使每个智能体拥有自己的追踪、评估和反馈循环,以实现自我验证。
Arize Phoenix宣布在AI Engineer: Europe会议上举办免费的两小时评估工作坊,由开发者关系主管Laurie Voss主讲,内容包括手动数据检查以及内置与自定义评估。
TanStack AI OpenTelemetry 官方支持现已推出,提供用于追踪、数据集和回放的开源后端,以提升可调试性。
本文讨论了使用 Arize Phoenix 开发 LLM 应用的最佳实践,特别强调了使用训练集/验证集/测试集拆分来进行诚实评估和追踪回归的重要性。