@ArizePhoenix: Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单…
摘要
Phoenix 引入了 Code Evaluators,允许用户在 UI 中直接用 Python 或 TypeScript 定义评估策略,支持服务端执行和可组合的评分方法。
Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单。真实的评估很少如此整洁。Code Evaluators 让你可以按照自己的方式构建评估标准。你可以在 Phoenix UI 中编写一个 Python 或 TypeScript 的 evaluate() 函数 — 无需 SDK、无需本地运行时、无需部署步骤 — Phoenix 会在服务端运行它,并将标签和分数作为注释记录在每次实验运行中。因为只是代码,你可以控制整个策略:
• 复合评分:将子评分(LLM 判断 + 确定性规则)混合成一个加权指标
• 基于嵌入的评估:使用嵌入的余弦相似度,而不是脆弱的字符串匹配
• LLM 陪审团:轮询多个模型并将裁决组合成加权共识
沙盒化的 Code Evaluators 也解锁了将智能体作为裁判的思路。我们对此方向感到兴奋。
相似文章
4B模型分类任务上60-82%的准确率波动:唯一变量是评估框架设计
一项研究显示,仅改变评估框架设计就能使4B参数模型的分类准确率从60%摆动到82%,凸显了评估方法的关键影响。
smevals - 一个用于评估模型、提示词和测试框架的小型评估套件
Simon Willison 介绍了 smevals,这是 Prime Radiant 开发的一个小型评估套件,用于评估模型、提示词和测试框架,提供运行评估、评分结果以及提供静态 HTML 报告的指令。
DeepSeek v4 Flash 初步测试显示 UI/UX 设计能力显著提升(尽管 token 消耗较大)
DeepSeek v4 Flash 的初步测试显示其 UI/UX 设计能力有显著提升,不过该模型仍十分消耗 token。
谷歌发布了一系列免费AI工具,取代了人们每年付费数百美元的软件。
谷歌发布了一套免费AI工具,取代付费软件,包括品牌生成器、UI构建器、AI集成开发环境和代码助手,并重点介绍了14个值得关注的示例。
我构建了一种方法,可在 AI 智能体任务中途失败时自动撤销混乱
一位开发者构建了 agent-undo,这是一个 TypeScript 库,可为 AI 代理的工具调用添加撤销/回滚处理器,使得如果任务中途某一步骤失败,之前已完成的步骤会自动撤销。