评估许可是什么?Inspect Evals 中基于提交绑定的主张相对推断普查

Hugging Face Daily Papers 论文

摘要

本文形式化了AI评估制品的主张重放层,并对评估单元进行普查,发现大多数单元在确定性推断前停止,原因在于缺失历史证据或语义基础。

评估制品指定了一个前向计算:任务、评分器和报告的指标。它们并不一定许可与该指标相关的主张,因为重放所需的历史证据和替代语义可能未绑定。我们通过冻结基底 D、基础族 F、主张查询 q 以及由此产生的识别集来形式化这个缺失的主张重放层。然后,我们对固定提交下的所有 124 个机械合格的 Inspect Evals 单元进行普查。每个单元都得到一个终端处置;110 个单元在确定性推断前停止,因为所需的历史证据或语义基础不可用。在执行关闭时,精确值、获胜者、完整顺序和成对关系根据主张解析和主要族与审查族进行区分。因此,审计返回类型化停止、不稳定性见证和稳定子结构,而不是强制一个评估者含义或一个鲁棒/不鲁棒标签。
查看原文
查看缓存全文

缓存时间: 2026/08/28 15:26

论文页面 - 评估许可证意味着什么?Inspect评估中声明相关推理的提交绑定普查

来源:https://huggingface.co/papers/2608.19269 发布于8月25日

·

提交者:https://huggingface.co/qxxxxxxxxxxx

qx (https://huggingface.co/qxxxxxxxxxxx) 于8月28日

摘要

评估构件规定了前向计算:一个任务、评分器和报告的指标。它们并不必然授权该指标所附带的声明,因为重放该声明所需的历史证据和备选语义可能是未绑定的。我们通过一个冻结基底D、一个有根基族F、一个声明查询q以及由此产生的识别集来形式化这个缺失的声明重放层。然后,我们在一个固定提交上普查所有124个机械上合格的Inspect评估单元。每个单元都得到一个终结处置;110个在确定性推理之前停止,因为所需的历史证据或语义根基不可用。在执行完成的情况下,确切值、胜者、完整顺序和成对关系按声明解析度以及主要与审查族系进行区分。因此,审计返回的是类型化停顿、不稳定性见证和稳定子结构,而不是强制单一评估器意义或单一稳健/不稳健标签。

查看 arXiv 页面 (https://arxiv.org/abs/2608.19269) 查看 PDF (https://arxiv.org/pdf/2608.19269) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19269)

通过您的代理获取本文:

hf papers read 2608.19269

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型:0

没有链接本文的模型

在模型的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。

引用本文的数据集:0

没有链接本文的数据集

在数据集的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。

引用本文的空间:0

没有链接本文的空间

在空间的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。

包含本文的收藏集:0

没有包含本文的收藏集

将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。

相似文章

Evaluation Cards: 一种AI评估报告的解释层

Hugging Face Daily Papers

本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。

LURE:通过真实使用回放评估降低评估意识

arXiv cs.CL

本文提出了LURE(真实使用回放评估),一种通过回放真实的智能体交互轨迹并在末尾附加评估提示来构建类似部署环境的真实评估的方法,与现有基准相比,降低了评估的可检测性。

评估陷阱:基准设计作为理论承诺

arXiv cs.AI

本文识别了“评估陷阱”,即人工智能基准测试无意中通过缩小“进步”的定义来稳定主导范式,并引入了Epistematics,一种元评估方法论,以确保评估标准能够区分真实能力与代理行为。