单个人工智能排行榜得分可能隐藏了正在改变的部分:评估工具

Reddit r/ArtificialInteligence 新闻

摘要

文章批评人工智能排行榜因隐藏评估工具的影响而简化了代理评估,以Questflow的智能财务基准为例,并强调代理基准中需要全面报告。

当只测试模型时,模型排行榜易于阅读。代理基准则更混乱:技能、工具、权限、数据访问和评估窗口都可能改变被评分的行为。Questflow使这个问题异常明显。它是一个智能财务评估工具,具有公开的实时基准,将裸模型代理和配备评估工具的前沿模型代理置于相同的资本和链上信号下进行比较。附带的历史快照还总结了七个维度的行为,使用实心形状表示模型加评估工具,虚线轮廓表示裸模型参赛者。这比单个排名更具信息量,但仍有两点需要说明。首先,裸模型/评估工具对并不自动构成受控消融。如果技能包、工具访问、权限范围或市场窗口不同,图表无法告诉我们哪个变量导致了差距。其次,诸如纪律、校准或一致性等标签描述的是评估设计。它们不是模型的永久个性特征。对于代理排行榜,最低有用报告应包括模型版本、评估工具或技能包、工具和数据、权限边界、环境和时间窗口、重复次数,以及可观察的推理或行动记录。这样,得分描述的是经过测试的系统,而不是悄悄借用模型名称。Questflow的有趣开放性问题是,当除了技能层之外的所有内容都保持不变时,其裸模型与配备评估工具的差异是否重复。在r/questflow中已经有一个早期的讨论线程在辩论这个具体选择:在一次观察后改变模型,还是先重复运行?这比“哪个模型今天赢了?”是个好得多的问题。
查看原文

相似文章

我们需要一个工具基准排行榜

Reddit r/AI_Agents

本文主张需要一个基准排行榜,用于比较AI模型工具(例如KimiCode、OpenCode和Codex),而不仅仅是模型本身,并提出了一个代码库,用于测试模型+工具组合的成本、运行时间、token使用量和得分。

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2057153343081111582

X AI KOLs Timeline

UIUC、Meta和斯坦福大学联合发布的一份100页调查报告引入了人工智能代理的三个 harness 层(接口、机制、Scaling),认为大多数代理失败源于 harness 问题而非推理缺陷,并提供了一个用于审计代理堆栈的分类体系。

重新思考智能体工具框架进化的评估

Hugging Face Daily Papers

本文重新思考了智能体自动工具框架进化应如何评估,指出性能提升可能源于增加的计算量而非真正的改进,并且进化后的工具框架难以泛化到未见过的任务。