@akshay_pachaar:模型评分并非智能体评分。模型基准测试通常隔离基础模型。然而,生产环境中的智能体……
摘要
文章强调,由于系统复杂性,模型基准测试无法准确评估生产环境中的智能体,并介绍了Apodex的TRACES以进行更全面的评估,引用了一篇研究论文。
查看缓存全文
缓存时间: 2026/09/28 11:34
模型评分不等于智能体评分。
模型基准测试通常只隔离基础模型本身进行评估。
然而生产环境中的智能体并非独立运行。它们运行在一个完整的系统内,该系统需要解析工具调用、存储历史记录、管理上下文、重试失败操作、执行预算限制,并决定任务何时完成。
一次失败的基准测试无法揭示故障是源于模型还是周边系统。
假设模型选择了正确的工具和参数,但适配器序列化某个字段时出错,导致环境拒绝该调用。
重试策略随后三次提交同样的畸形请求,历史记录不断累积,有用观察结果超出上下文窗口,最终在达到操作预算后终止运行。
最终得分为零——尽管模型选择了正确的操作。
更换模型可能会改变下次运行结果,但无法隔离原始故障原因。工具适配器、重试策略、上下文策略或停止规则都可能导致相同结果。
受控的智能体评估应当固定任务、数据、工具、预算和验证器。这样同一模型可以在两种配置下运行:
参考配置在固定控制循环中测量模型表现;提交配置则测量工程团队计划部署的完整系统。
这两个结果的差异,可估算出评估框架对该模型和任务的贡献值。
Apodex将这套对比方法集成到了TRACES系统中。
TRACES代表工具、修复、替代方案、连贯性、证据和范围,这是其HDS6评估体系采用的六个过程维度。
开发者可以提交托管模型、检查点或完整智能体系统。
模型提交通过固定的参考框架运行;完整系统提交也可使用被测框架运行,从而获得可对比的参考结果和端到端系统结果。
配套论文在七个选定的LLM环境中,通过固定模型配置测试了四种与模型无关的框架,我与Apodex合作本文展示了其运作方式。
使用Opus模型时,ApodexHarness以0.611分领先;而GPT模型下A-Evolve以0.648分领先。框架排名随模型变化,因此这些实验并未产生通用的最优解。
论文全文可通过此链接阅读:https://huggingface.co/papers/2608.11341…
模型选择与框架选择存在交互效应。若将两者视为单一变量制定排行榜,将无法判断哪个组件需要改进。
理解这种差异还需要了解智能体框架包含的内容。
我将其分解为11个生产组件,包括编排循环、工具、记忆、状态持久化和防护机制。
详细内容如下:
论文页面 - Apodex Discovery:用于评估与构建发现式人工智能的现实基准与环境
来源:https://huggingface.co/papers/2608.11341 发布于8月11日
当日论文排名第三 (https://huggingface.co/papers/date/2026-08-17) 作者:
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
,
摘要
Apodex Discovery引入了一个框架,通过重型求解器和结构化评估实现可验证的扩展性AI研究,覆盖真实世界科学任务。
阿波罗计划成功登月,不仅因为工程师能解出复杂方程,更在于它将远大愿景转化为包含明确目标、模拟验证和持续修正的系统架构。当前AI正面临类似转型:前沿模型在问题、工具和成功标准明确后,能够解决复杂任务,但现实世界的重要挑战很少以可执行或可验证的形式呈现。我们推出Apodex Discovery (https://huggingface.co/papers?q=Apodex%20Discovery),这是一个通过重型求解器 (https://huggingface.co/papers?q=heavy-duty%20solver)构建和评估发现式AI的框架。该系统包含基础模型 (https://huggingface.co/papers?q=foundation%20model)、评估框架 (https://huggingface.co/papers?q=harness)、工具和控制策略 (https://huggingface.co/papers?q=control%20policies),能够执行需要状态维护、可验证性的扩展调查。其包含三大核心组件:首先,问题侦察 (https://huggingface.co/papers?q=problem-scouting)过程调研了16个行业的561个领域,收集423个高价值现实问题,并为首发版本精选20个问题;其次,通用的环境-任务-情景抽象 (https://huggingface.co/papers?q=environment-task-episode%20abstraction)提供数据、工具、约束、反馈、轨迹记录以及中间产物和最终提交物的验证功能;第三,HDS6评估 (https://huggingface.co/papers?q=HDS6)从工具、修复、替代方案、连贯性、证据和范围六个维度独立于最终任务成功进行评估。在AAV衣壳设计 (https://huggingface.co/papers?q=AAV%20capsid%20design)任务中,Apodex在活性、趋向性、结构预测和生成设计方面超越已发表最优结果7%;在药物重定位 (https://huggingface.co/papers?q=drug%20repurposing)与再配方任务中,特定生物医学环境使GPT-5.5和GPT-5.6-sol的平均归一化预测分数分别提升2.5和7.6分。对照消融实验证明,固定的TRACES (https://huggingface.co/papers?q=TRACES)情景接口可将性能差异归因于特定求解器组件。Apodex Discovery (https://huggingface.co/papers?q=Apodex%20Discovery)推动AI评估从预设基准迈向面向真实发现的可验证调查。
查看arXiv页面 (https://arxiv.org/abs/2608.11341) | 查看PDF (https://arxiv.org/pdf/2608.11341) | 项目主页 (https://discovery.apodex.com/) | 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11341)
在你的智能体中获取本文:
hf papers read 2608\.11341
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型数
0
尚无模型关联本文
在模型README.md中引用arxiv.org/abs/2608.11341即可从本页关联。
引用本文的数据集数
0
尚无数据集关联本文
在数据集README.md中引用arxiv.org/abs/2608.11341即可从本页关联。
引用本文的空间数
0
尚无空间关联本文
在空间README.md中引用arxiv.org/abs/2608.11341即可从本页关联。
包含本文的合集数
2
相似文章
你的AI智能体在基准测试中表现优异,但在生产环境中为何仍然失败?
文章讨论了AI智能体的基准现实差距,即高基准分数并不保证在真实生产环境中的可靠性能,强调了需要更好的评估指标。
合并你PR的智能体,尚无基准可循。
Artificial Analysis 推出了一个编码智能体指数,该指数分别测试框架与模型的组合,强调基准测试任务与实际生产需求不同。文章认为,团队应基于自身的代码库和工作流来评估智能体配置,而非仅依赖标准化基准。
模型能给出正确答案,但代理仍然无法完成任务
文章讨论了在外部系统上的AI代理评估中,模型决策质量与执行完整性之间的差距,提出了对决策正确性和任务成功完成分别计分的方式。
K-Bench:评估模型在真实科学代理请求中的性能
论文介绍了 K-Bench 01,一个用于评估 AI 代理在真实科学请求中性能的基准,揭示了没有模型能持续达到可接受性能的阈值,过度声明是常见的失败模式。
仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估
RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。