@ArizePhoenix: 实验基准化与图表 当试图判断新模型是否胜任时,需要考虑很多…
摘要
Phoenix 现在包含可定制的实验图表和基准化功能,允许用户沿性能、延迟、令牌和成本维度比较模型,并为偏好模型设定基准。
实验基准化与图表
当试图判断新模型是否胜任时,需要考虑多个维度。
- 性能:通过评估(evals)衡量
- 延迟:模型是否足够快以提供良好的用户体验
- 令牌:模型为达成结果需要多少对话
- 成本:团队是否能负担使用该模型
这就是为什么 Phoenix 现在提供可定制的实验图表和基准化功能。根据你关心的维度比较实验,并在找到喜欢的模型后设定基准。
查看缓存全文
缓存时间: 2026/07/11 13:30
实验基线与图表
在判断新模型是否胜任时,你需要考虑多个维度。
- 性能 - 通过评测来衡量
- 延迟 - 模型是否足够快以提供良好的用户体验
- 令牌 - 在达成结果的过程中,模型的“话痨”程度
- 成本 - 团队能否负担使用此模型的费用
正因如此,Phoenix 现在提供了可自定义的实验图表与基线功能。你可以根据自己关心的维度对实验进行比较,并在找到心仪的模型后设定一个基线。
相似文章
@ArizePhoenix: Phoenix 17.7.0 让您的令牌使用情况清晰可读。新令牌详情图表将提示 + 完成令牌分解为各个部分…
Phoenix 17.7.0 新增令牌详情图表,将提示和完成令牌分解为子类别,并支持平移、缩放和实时流功能,以便更好地观察 AI 模型的令牌使用情况。
@ArizePhoenix: • 更快的追踪分析: 使用自然语言过滤器、一键图表缩放和专用注释列。 • 扩展…
Arize Phoenix 宣布更新,包括使用自然语言过滤器的更快追踪分析,以及用于管理保留分配和模型提供商的扩展 REST API。
@ArizePhoenix:我们最喜欢的工具是那些具有最大可定制性的工具。上周我们添加了可定制图表、命令K和一……
Arize Phoenix 宣布为其AI代理监控平台新增定制功能,包括可定制图表、命令K、最近搜索以及自定义列排序。
@ArizePhoenix: 你可以直接使用PXI在Phoenix上运行实验!这里有一个测试系统提示与schema感知提示的实验…
Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。
ChartArena:跨语言、场景和格式的图表解析基准测试
ChartArena是一个全面的双语图表解析基准,覆盖八个图表系列和三种视觉场景(数字、打印、手绘),使用人机协同标注流程和格式无关评估。对26个多模态大语言模型的评估显示,虽然专有模型整体领先,但开源模型正在追赶,而图示结构和手绘场景仍具挑战性。