@ArizePhoenix: Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单…

X AI KOLs Following 工具

摘要

Phoenix 引入了 Code Evaluators,允许用户在 UI 中直接用 Python 或 TypeScript 定义评估策略,支持服务端执行和可组合的评分方法。

Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单。真实的评估很少如此整洁。Code Evaluators 让你可以按照自己的方式构建评估标准。你可以在 Phoenix UI 中编写一个 Python 或 TypeScript 的 evaluate() 函数 — 无需 SDK、无需本地运行时、无需部署步骤 — Phoenix 会在服务端运行它,并将标签和分数作为注释记录在每次实验运行中。因为只是代码,你可以控制整个策略: • 复合评分:将子评分(LLM 判断 + 确定性规则)混合成一个加权指标 • 基于嵌入的评估:使用嵌入的余弦相似度,而不是脆弱的字符串匹配 • LLM 陪审团:轮询多个模型并将裁决组合成加权共识 沙盒化的 Code Evaluators 也解锁了将智能体作为裁判的思路。我们对此方向感到兴奋。
查看原文

相似文章