@ArizePhoenix: Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单…
摘要
Phoenix 引入了 Code Evaluators,允许用户在 UI 中直接用 Python 或 TypeScript 定义评估策略,支持服务端执行和可组合的评分方法。
Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单。真实的评估很少如此整洁。Code Evaluators 让你可以按照自己的方式构建评估标准。你可以在 Phoenix UI 中编写一个 Python 或 TypeScript 的 evaluate() 函数 — 无需 SDK、无需本地运行时、无需部署步骤 — Phoenix 会在服务端运行它,并将标签和分数作为注释记录在每次实验运行中。因为只是代码,你可以控制整个策略:
• 复合评分:将子评分(LLM 判断 + 确定性规则)混合成一个加权指标
• 基于嵌入的评估:使用嵌入的余弦相似度,而不是脆弱的字符串匹配
• LLM 陪审团:轮询多个模型并将裁决组合成加权共识
沙盒化的 Code Evaluators 也解锁了将智能体作为裁判的思路。我们对此方向感到兴奋。
相似文章
DeepSeek v4 Flash 初步测试显示 UI/UX 设计能力显著提升(尽管 token 消耗较大)
DeepSeek v4 Flash 的初步测试显示其 UI/UX 设计能力有显著提升,不过该模型仍十分消耗 token。
谷歌发布了一系列免费AI工具,取代了人们每年付费数百美元的软件。
谷歌发布了一套免费AI工具,取代付费软件,包括品牌生成器、UI构建器、AI集成开发环境和代码助手,并重点介绍了14个值得关注的示例。
我构建了一种方法,可在 AI 智能体任务中途失败时自动撤销混乱
一位开发者构建了 agent-undo,这是一个 TypeScript 库,可为 AI 代理的工具调用添加撤销/回滚处理器,使得如果任务中途某一步骤失败,之前已完成的步骤会自动撤销。
@PythonHub: Graphify-Labs / graphify 将任何代码库及其文档、SQL 模式、配置和 PDF 转化为可查询的知识图…
Graphify 是一款开源工具,可将代码库、文档、SQL 模式、配置和 PDF 转化为可查询的知识图谱,供 Claude Code、Cursor、Codex 和 Gemini CLI 等 AI 编程助手使用。它采用本地确定性的 AST 解析,无需向量存储。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。