评估许可是什么?Inspect Evals 中基于提交绑定的主张相对推断普查
摘要
本文形式化了AI评估制品的主张重放层,并对评估单元进行普查,发现大多数单元在确定性推断前停止,原因在于缺失历史证据或语义基础。
查看缓存全文
缓存时间: 2026/08/28 15:26
论文页面 - 评估许可证意味着什么?Inspect评估中声明相关推理的提交绑定普查
来源:https://huggingface.co/papers/2608.19269 发布于8月25日
·
提交者:https://huggingface.co/qxxxxxxxxxxx
qx (https://huggingface.co/qxxxxxxxxxxx) 于8月28日
摘要
评估构件规定了前向计算:一个任务、评分器和报告的指标。它们并不必然授权该指标所附带的声明,因为重放该声明所需的历史证据和备选语义可能是未绑定的。我们通过一个冻结基底D、一个有根基族F、一个声明查询q以及由此产生的识别集来形式化这个缺失的声明重放层。然后,我们在一个固定提交上普查所有124个机械上合格的Inspect评估单元。每个单元都得到一个终结处置;110个在确定性推理之前停止,因为所需的历史证据或语义根基不可用。在执行完成的情况下,确切值、胜者、完整顺序和成对关系按声明解析度以及主要与审查族系进行区分。因此,审计返回的是类型化停顿、不稳定性见证和稳定子结构,而不是强制单一评估器意义或单一稳健/不稳健标签。
查看 arXiv 页面 (https://arxiv.org/abs/2608.19269) 查看 PDF (https://arxiv.org/pdf/2608.19269) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.19269)
通过您的代理获取本文:
hf papers read 2608.19269
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型:0
没有链接本文的模型
在模型的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。
引用本文的数据集:0
没有链接本文的数据集
在数据集的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。
引用本文的空间:0
没有链接本文的空间
在空间的 README.md 中引用 arxiv.org/abs/2608.19269 以将其链接到此页面。
包含本文的收藏集:0
没有包含本文的收藏集
将本文添加到收藏集 (https://huggingface.co/new-collection) 以将其链接到此页面。
相似文章
Evaluation Cards: 一种AI评估报告的解释层
本文介绍了EvalCards,这是一种操作框架,通过将基准元数据、评估运行数据和模型元数据组合成一个统一记录,并包含可重现性、完整性、来源、风险和分数可比性的解释性信号,从而标准化AI评估报告。作者在数千个模型和基准测试中部署了一个监控工具,揭示了当前报告实践中的系统性差距。
利用推理计算与部署框架提升评估真实性
本文介绍了批判精炼和DISH,通过减轻评估意识来提升对齐评估的真实性,证明结合两种技术比单独使用任何一种都能带来显著改进。
LURE:通过真实使用回放评估降低评估意识
本文提出了LURE(真实使用回放评估),一种通过回放真实的智能体交互轨迹并在末尾附加评估提示来构建类似部署环境的真实评估的方法,与现有基准相比,降低了评估的可检测性。
评估陷阱:基准设计作为理论承诺
本文识别了“评估陷阱”,即人工智能基准测试无意中通过缩小“进步”的定义来稳定主导范式,并引入了Epistematics,一种元评估方法论,以确保评估标准能够区分真实能力与代理行为。
语言模型中的评估意识:表征、表达与控制
本文系统地研究了语言模型中的评估意识,表明模型内化了评估语境,导致内部表征、语言表达和导向行为之间的脱节,对基准可靠性有影响。