@akshay_pachaar:模型评分并非智能体评分。模型基准测试通常隔离基础模型。然而,生产环境中的智能体……

X AI KOLs Timeline 论文

摘要

文章强调,由于系统复杂性,模型基准测试无法准确评估生产环境中的智能体,并介绍了Apodex的TRACES以进行更全面的评估,引用了一篇研究论文。

模型评分并非智能体评分。 模型基准测试通常隔离基础模型。 然而,生产环境中的智能体并非孤立运行。相反,它们在一个系统中运行,该系统解析工具调用、存储历史记录、管理上下文、重试失败的操作、执行预算,并决定任务何时完成。 基准测试运行失败并不能揭示是模型还是周围系统导致了失败。 假设模型选择了正确的工具和参数,但适配器序列化了一个字段不正确。环境拒绝该调用。 然后重试策略提交相同的格式错误的请求三次。历史记录增长,有用的观察结果超出上下文,运行在达到行动预算后停止。 最终评分为零,即使模型选择了正确的操作。 更换模型可能会改变下一次运行,但无法隔离原始失败。工具适配器、重试策略、上下文策略或停止规则可能导致相同的结果。 受控的智能体评估应固定任务、数据、工具、预算和验证器。然后,相同的模型可以在两种配置下运行。 参考配置在固定的控制循环内测量模型。提交的配置测量工程团队计划部署的完整系统。 这些结果之间的差异估计了该工具链对该模型和任务的贡献。 Apodex将这种比较构建到了TRACES中。 TRACES代表工具、修复、替代、一致性、证据和范围,这是其HDS6评估中使用的六个过程维度。 开发者可以提交托管模型、检查点或完整的智能体系统。 模型提交通过固定的参考工具链运行。完整系统提交也可以使用提交的工具链运行,产生可比较的参考结果和端到端系统结果。 随附的论文在七个选定的LLM环境中测试了四个与模型无关的工具链,使用固定的模型配置,我与Apodex合作撰写此文以展示其工作原理。 ApodexHarness以Opus的0.611领先,而A-Evolve以GPT的0.648领先。工具链排序随模型变化,因此这些实验没有产生一个普遍的赢家。 您可以在此处阅读论文:https://huggingface.co/papers/2608.11341… 模型选择和工具链选择相互影响。将它们视为单一变量的排行榜无法显示哪个组件需要改进。 解释这种差异还需要理解智能体工具链包含什么。 我分解了它的11个生产组件,包括编排循环、工具、内存、状态持久性和护栏。 阅读以下内容。
查看原文
查看缓存全文

缓存时间: 2026/09/28 11:34

模型评分不等于智能体评分。

模型基准测试通常只隔离基础模型本身进行评估。

然而生产环境中的智能体并非独立运行。它们运行在一个完整的系统内,该系统需要解析工具调用、存储历史记录、管理上下文、重试失败操作、执行预算限制,并决定任务何时完成。

一次失败的基准测试无法揭示故障是源于模型还是周边系统。

假设模型选择了正确的工具和参数,但适配器序列化某个字段时出错,导致环境拒绝该调用。

重试策略随后三次提交同样的畸形请求,历史记录不断累积,有用观察结果超出上下文窗口,最终在达到操作预算后终止运行。

最终得分为零——尽管模型选择了正确的操作。

更换模型可能会改变下次运行结果,但无法隔离原始故障原因。工具适配器、重试策略、上下文策略或停止规则都可能导致相同结果。

受控的智能体评估应当固定任务、数据、工具、预算和验证器。这样同一模型可以在两种配置下运行:

参考配置在固定控制循环中测量模型表现;提交配置则测量工程团队计划部署的完整系统。

这两个结果的差异,可估算出评估框架对该模型和任务的贡献值。

Apodex将这套对比方法集成到了TRACES系统中。

TRACES代表工具、修复、替代方案、连贯性、证据和范围,这是其HDS6评估体系采用的六个过程维度。

开发者可以提交托管模型、检查点或完整智能体系统。

模型提交通过固定的参考框架运行;完整系统提交也可使用被测框架运行,从而获得可对比的参考结果和端到端系统结果。

配套论文在七个选定的LLM环境中,通过固定模型配置测试了四种与模型无关的框架,我与Apodex合作本文展示了其运作方式。

使用Opus模型时,ApodexHarness以0.611分领先;而GPT模型下A-Evolve以0.648分领先。框架排名随模型变化,因此这些实验并未产生通用的最优解。

论文全文可通过此链接阅读:https://huggingface.co/papers/2608.11341…

模型选择与框架选择存在交互效应。若将两者视为单一变量制定排行榜,将无法判断哪个组件需要改进。

理解这种差异还需要了解智能体框架包含的内容。

我将其分解为11个生产组件,包括编排循环、工具、记忆、状态持久化和防护机制。

详细内容如下:


论文页面 - Apodex Discovery:用于评估与构建发现式人工智能的现实基准与环境

来源:https://huggingface.co/papers/2608.11341 发布于8月11日

当日论文排名第三 (https://huggingface.co/papers/date/2026-08-17) 作者:

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

,

摘要

Apodex Discovery引入了一个框架,通过重型求解器和结构化评估实现可验证的扩展性AI研究,覆盖真实世界科学任务。

阿波罗计划成功登月,不仅因为工程师能解出复杂方程,更在于它将远大愿景转化为包含明确目标、模拟验证和持续修正的系统架构。当前AI正面临类似转型:前沿模型在问题、工具和成功标准明确后,能够解决复杂任务,但现实世界的重要挑战很少以可执行或可验证的形式呈现。我们推出Apodex Discovery (https://huggingface.co/papers?q=Apodex%20Discovery),这是一个通过重型求解器 (https://huggingface.co/papers?q=heavy-duty%20solver)构建和评估发现式AI的框架。该系统包含基础模型 (https://huggingface.co/papers?q=foundation%20model)、评估框架 (https://huggingface.co/papers?q=harness)、工具和控制策略 (https://huggingface.co/papers?q=control%20policies),能够执行需要状态维护、可验证性的扩展调查。其包含三大核心组件:首先,问题侦察 (https://huggingface.co/papers?q=problem-scouting)过程调研了16个行业的561个领域,收集423个高价值现实问题,并为首发版本精选20个问题;其次,通用的环境-任务-情景抽象 (https://huggingface.co/papers?q=environment-task-episode%20abstraction)提供数据、工具、约束、反馈、轨迹记录以及中间产物和最终提交物的验证功能;第三,HDS6评估 (https://huggingface.co/papers?q=HDS6)从工具、修复、替代方案、连贯性、证据和范围六个维度独立于最终任务成功进行评估。在AAV衣壳设计 (https://huggingface.co/papers?q=AAV%20capsid%20design)任务中,Apodex在活性、趋向性、结构预测和生成设计方面超越已发表最优结果7%;在药物重定位 (https://huggingface.co/papers?q=drug%20repurposing)与再配方任务中,特定生物医学环境使GPT-5.5和GPT-5.6-sol的平均归一化预测分数分别提升2.5和7.6分。对照消融实验证明,固定的TRACES (https://huggingface.co/papers?q=TRACES)情景接口可将性能差异归因于特定求解器组件。Apodex Discovery (https://huggingface.co/papers?q=Apodex%20Discovery)推动AI评估从预设基准迈向面向真实发现的可验证调查。

查看arXiv页面 (https://arxiv.org/abs/2608.11341) | 查看PDF (https://arxiv.org/pdf/2608.11341) | 项目主页 (https://discovery.apodex.com/) | 添加至收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.11341)

在你的智能体中获取本文:

hf papers read 2608\.11341

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型数

0

尚无模型关联本文

在模型README.md中引用arxiv.org/abs/2608.11341即可从本页关联。

引用本文的数据集数

0

尚无数据集关联本文

在数据集README.md中引用arxiv.org/abs/2608.11341即可从本页关联。

引用本文的空间数

0

尚无空间关联本文

在空间README.md中引用arxiv.org/abs/2608.11341即可从本页关联。

包含本文的合集数

2

相似文章

合并你PR的智能体,尚无基准可循。

Reddit r/AI_Agents

Artificial Analysis 推出了一个编码智能体指数,该指数分别测试框架与模型的组合,强调基准测试任务与实际生产需求不同。文章认为,团队应基于自身的代码库和工作流来评估智能体配置,而非仅依赖标准化基准。

仅靠基准测试不够:RAMP——生产系统中代理模型的运行时评估

Hugging Face Daily Papers

RAMP是一个基于生产环境的LLM代理评估框架,可揭示静态基准测试无法察觉的显著能力退化,显示任务完成率在串行工作流中从100%骤降至20%。该框架在真实的编译器构建工作负载上评估了15个主流模型,涉及复杂的工具链交互和分阶段恢复机制。