标签
一项统计显示,在生产中,89%的代理团队拥有可观测性,但只有52%运行评估,这引发了关于如何控制提示变更的问题。
eve 现在内置了对智能体的评估能力,解决了 AI 智能体开发中需要第一方测试的问题。
Philipp Schmid 宣布他将参加 aiDotEngineer 大会,届时会讨论智能体和评估,并可以在 GoogleDeepMind 展台或演讲中找到他。
Latent Space 播客邀请 OpenAI 首席研究官 Mark Chen,在烹饪过程中讨论扩展定律、预训练、评估危机以及 OpenAI 的研究路线图。
Vercel 解释了如何构建一个包含技能、代码检查器、评估工具和更新循环的系统,以确保编码代理符合他们的设计标准。
分享一个精选的AI评估(evals)资源库,包含高质量博客、播客、论文和项目,由Xiangyi Li整理。
几乎所有AI模型和智能体的进步都依赖于评估(evals)。通过评估理解工作流程和智能体性能将成为企业推动自动化的核心能力。
@DeRonin_在推文中为2026年的AI工程师提供建议,强调交付真实应用、掌握核心技能、使用廉价模型、广泛部署、开源项目以及聚焦单一职业赛道。
一条解释构建生产级AI系统所需的六个关键AI概念(token、嵌入、向量搜索等)的推文串,强调理解这些概念可以避免像API成本失控等代价高昂的失败。
@TheAhmadOsman 的一条推文强调本地AI是未来,并推荐学习诸如运行开源模型、进行评估以及通过微调定制模型等技能。
Adaline 2.0 是一个智能体自我改进层,它观察真实用户交互,按模式对失败进行聚类,每天自动编写数百个测试,并在部署前生成新的智能体候选版本供审批。
一份全面的免费在线指南现已发布,涵盖机器学习与LLM的基准测试、评估、数据污染及正确实践,强调清洁测量的重要性,避免在测试集上进行误导性训练。
文章讨论了AI工程循环如何能够完全自动化,但认为将整个循环交给AI会产生'agent slop'(智能体垃圾),因为评估不完善。它建议自动执行某些步骤,同时保留人类判断以处理细微差别。
构建了一个本地控制系统来管理代理改进循环,捕获跟踪,发现重复故障,使用Codex/Claude Code起草修复方案,并仅在通过检查和评估后应用更改。
这条推文概述了2026年LLM训练的三步循环:用数据训练、运行评估、为表现不佳的任务添加合成数据。它强调了通过开源模型和廉价API进行合法蒸馏的易得性,并指出仅凭推理轨迹训练就能获得高分。
Cognition发布了Devin的首个评估套件,提供长达100小时的企业级评估并附有财务保证。数据集包含来自126家企业用户的真实Java/TypeScript/Python/C#任务,旨在比现有基准更准确地衡量工程生产力。