QuoteBench: 匹配分数如何掩盖命令路径失败

Hugging Face Daily Papers 论文

摘要

QuoteBench 揭示了执行边界解析错误显著降低了大型语言模型编程代理的成功率,并且披露边界有助于恢复性能,这表明评估必须考虑部署配置,而不是将匹配分数视为模型的内在属性。

大型语言模型编程代理通过可能序列化、包装和重新解析模型输出的接口发出 Bash 命令。仅匹配执行分数无法区分命令生成错误和生成后引入的失败。QuoteBench 通过在 14 个事件派生家族的 56 个单次任务上进行精确最终状态验证来测量此边界,围绕一个故意未转义的附加解析器跨越生成契约与执行传输。在插值点处转义重现了每个重放回复的原始路径结果,因此在披露边界下的任何恢复必须来自模型改变其生成。在八个相同窗口配置中,通过附加解析器重放相同的回复使成功率降低了 55.4 至 73.2 个百分点;披露为六个配置恢复了 30.4 至 60.7 个百分点,对于另外两个配置则为零或略为负。原始生成在前沿已近饱和;边界适应仍然是区分模型的关键。GPT-5.6-sol 的匹配差距为 -3.6 个百分点,掩盖了 -64.3 个百分点的损害和 +60.7 个百分点的补偿。部署配置重新排序模型:在 26 个可比配对中有一个明确的逆转,还有四个处于单任务边缘。对发出命令代理的评估应报告模型配置、生成契约、执行路径、操作点和最终状态验证器,而不是将匹配分数视为模型的内在属性。
查看原文
查看缓存全文

缓存时间: 2026/08/21 16:10

论文页面 - QuoteBench:匹配分数如何掩盖命令路径故障

来源:https://huggingface.co/papers/2608.13547 发布于8月13日

·

提交者https://huggingface.co/lsamc

lsamc (https://huggingface.co/lsamc)于8月21日

摘要

QuoteBench揭示:执行边界解析错误会显著降低LLM编程智能体的成功率,而披露该边界信息有助于恢复性能。这表明评估必须考虑部署配置,而非将匹配分数视为模型的固有属性。

LLM编程智能体 (https://huggingface.co/papers?q=LLM%20coding%20agents) 通过可能对模型输出进行序列化、包装和重新解析的接口发布Bash命令 (https://huggingface.co/papers?q=Bash%20commands)。仅凭匹配的执行分数无法区分命令生成错误与生成后引入的故障。QuoteBench (https://huggingface.co/papers?q=QuoteBench) 通过在56个来自14个事件衍生类别的单次任务上进行精确的最终状态验证 (https://huggingface.co/papers?q=final-state%20validation) 来衡量此边界,其中包含一个故意未转义的附加解析器 (https://huggingface.co/papers?q=parser),从而在生成契约 (https://huggingface.co/papers?q=generation%20contract) 与执行传输 (https://huggingface.co/papers?q=execution%20transport) 之间产生冲突。在插值点处转义可以重现每个重放回复的原始路径结果,因此在披露边界下的任何性能恢复必须来自模型生成方式的改变。在八种相同窗口配置中,通过附加解析器 (https://huggingface.co/papers?q=parser) 重放相同回复使成功率降低了55.4至73.2个百分点;对于六种配置,披露边界可恢复30.4至60.7个百分点,其余两种配置恢复为零或略微为负。原始生成能力在前沿已接近饱和;边界适应 (https://huggingface.co/papers?q=boundary%20adaptation) 仍是区分模型的关键。GPT-5.6-sol的匹配差距为-3.6分,但这掩盖了-64.3分的损害和+60.7分的补偿。部署配置重新排列了模型排名:26对可比配置中有一处明确的逆转,另有四处处于单任务边界。命令发布智能体的评估应报告模型配置、生成契约 (https://huggingface.co/papers?q=generation%20contract)、执行路径、工作点和最终状态验证器,而非将匹配分数视为模型的固有属性。

查看arXiv页面 (https://arxiv.org/abs/2608.13547)查看PDF (https://arxiv.org/pdf/2608.13547)项目页面 (https://quotebench.lsamc.website/)GitHub3 (https://github.com/LeonardNJU/quoteBench)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.13547)

在智能体中获取本文:

hf papers read 2608\.13547

没有最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型0

无模型链接本文

在模型README.md中引用arxiv.org/abs/2608.13547以从本页面链接。

引用本文的数据集1

lsamc/QuoteBench-Rollouts查看器• 更新于6天前 • 13k • 373 • 1 (https://huggingface.co/datasets/lsamc/QuoteBench-Rollouts)

引用本文的Space0

无Space链接本文

在Space的README.md中引用arxiv.org/abs/2608.13547以从本页面链接。

包含本文的收藏0

无收藏包含本文

将本文添加到收藏 (https://huggingface.co/new-collection)以从本页面链接。

相似文章

分数持平,失败放大:误差预算如何掩盖量化LLM智能体的损害

arXiv cs.LG

本文研究了关于4位权重量化对LLM智能体几乎无损的说法,表明虽然整体基准分数持平,但量化放大了现有的工具调用失败(例如幻觉),这些失败被基准的误差预算所掩盖。作者建议报告每通道错误率以及在缩小预算下的成功率,以揭示被掩盖的损害。

基准测试末日

Lobsters Hottest

本文揭示了大型语言模型如何轻松操纵性能基准测试,导致虚假的软件优化声明,例如一个过度拟合基准的正则表达式引擎。