@ArizePhoenix: Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单…
摘要
Phoenix 引入了 Code Evaluators,允许用户在 UI 中直接用 Python 或 TypeScript 定义评估策略,支持服务端执行和可组合的评分方法。
Phoenix 现在允许你在代码中组合评估策略。大多数评估工具只提供一个固定的裁判模板菜单。真实的评估很少如此整洁。Code Evaluators 让你可以按照自己的方式构建评估标准。你可以在 Phoenix UI 中编写一个 Python 或 TypeScript 的 evaluate() 函数 — 无需 SDK、无需本地运行时、无需部署步骤 — Phoenix 会在服务端运行它,并将标签和分数作为注释记录在每次实验运行中。因为只是代码,你可以控制整个策略:
• 复合评分:将子评分(LLM 判断 + 确定性规则)混合成一个加权指标
• 基于嵌入的评估:使用嵌入的余弦相似度,而不是脆弱的字符串匹配
• LLM 陪审团:轮询多个模型并将裁决组合成加权共识
沙盒化的 Code Evaluators 也解锁了将智能体作为裁判的思路。我们对此方向感到兴奋。
相似文章
tool-prune:在0.4毫秒内将50多个工具Schema精简至候选(-92%提示令牌,零依赖)
tool-prune是一个工具,用于在调用本地LLM模型前精简工具Schema,减少92%的提示令牌并避免幻觉,无需额外LLM轮询。
Prism-ML Bonsai 2 加入我们的 Qwen3.8 量化比较
Prism-LM 的基于 Qwen3.8 的 Bonsai 2 QAT 模型已被评估并加入比较研究,在综合基准测试中达到约 91.5%,并为模型权衡提供了可靠的参考。
Cloudflare 快速隧道
Cloudflare 快速隧道提供了一种免费且安全的方式,可以通过单条命令立即将本地应用部署到互联网,通过 Cloudflare 的全球网络提供自动 HTTPS 和 DDoS 防护。
AI代理消耗令牌速度快于订阅刷新——我追踪刷新时间
作者维护一个公共页面,追踪来自OpenAI、Anthropic和Google的AI模型订阅的免费和付费配额重置时间表,以帮助开发者在运行代理时管理成本。
在评估AI开发公司时,你实际关注哪些方面?
本文讨论了评估AI开发公司的关键标准,强调了在可扩展项目中,全栈能力、生产可靠性和领域经验相比单纯模型专业知识的重要性。