Ventor-QTest: 威胁模型驱动的供应商托管LLM API验证

Hugging Face Daily Papers 论文

摘要

Ventor-QTest提出了一种针对供应商托管LLM API的黑盒审计方法,通过重复和长序列探测来测量保真度损失并检测长期代理任务中的退化。

随着大型语言模型日益普及,部署开放权重模型的第三方供应商已成为生态系统的重要组成部分。因此,审计其推理API的质量是一个开放问题。我们将托管模型路由形式化为一个随机过程,并提出\textbf{Ventor-QTest},一种无需目标API提供概率信息的复合黑盒审计方法。其重复请求组件将每个冻结约束上下文多次发送到目标,从返回的文本计数中重建分类输出分布,并报告平均保真度损失(AFL)作为零偏差校正的窗口内平均粗糙化KL统计量。其长序列组件使用独立运行,通过运行级参考中心惊讶度统计量的经验上尾报告极端保真度损失(EFL)。在三个支持对数概率的路由条件下,AFL显示出与基于对数概率的粗糙化KL比较器强烈的线性描述一致性。在七个路由快照中,20次运行的序列探测揭示了特定路由的EFL变化。AFL和EFL与GPQA-Diamond准确性没有显著的路由级关联。相反,显著的EFL与任务暴露增加时Terminal-Bench通过率的下降同时出现。这种模式可能是因为长期任务中的正确性对极端保真度损失更为敏感。这些结果促使联合报告AFL和EFL,特别是在审计长期代理任务时。开源实现可在https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest获取。
查看原文
查看缓存全文

缓存时间: 2026/08/18 03:51

论文页面 - Ventor-QTest:面向供应商托管LLM API的威胁模型驱动验证

来源:https://huggingface.co/papers/2608.16391 发布于 8月17日

·

由 https://huggingface.co/xiangfanwu 提交

wu (https://huggingface.co/xiangfanwu) 于 8月18日

摘要

Ventor-QTest 通过重复的、长序列的黑盒探测,对托管的开放权重模型API进行审计,测量平均和极端保真度损失,以检测长期智能体性能的退化。

随着大型语言模型日益普及,部署开放权重模型的第三方提供商已成为生态系统的重要组成部分。因此,审计其推理API的质量是一个开放性问题。我们将托管模型路由形式化为一个随机过程,并提出 Ventor-QTest(一种组合式黑盒审计),它不需要目标API提供任何概率信息。其重复请求组件将每个固定的约束上下文多次发送至目标API,根据返回的文本计数重构一个分类输出分布,并报告作为无偏置校正的窗口内平均粗化KL统计量的 平均保真度损失 (AFL)。其长序列组件使用独立运行,通过运行级的参考中心化惊讶度统计量的经验上尾来报告 极端保真度损失 (EFL)。在三个支持对数概率的路由条件下,AFL显示出与基于对数概率的粗化KL比较器强烈的线性描述性一致性。在七个路由快照中,20次运行的序列探测揭示了特定于路由的EFL变化。AFL和EFL与 GPQA-Diamond 准确率几乎没有可检测到的路由级关联。相反,显著的EFL与随着任务暴露增加而 Terminal-Bench 通过率下降相吻合。这种模式可能源于长期任务中的正确性对 极端保真度损失 更为敏感。这些结果推动了在审计 长期智能体任务 时联合报告AFL和EFL。开源实现可在 https://github.com/Tencent/AI-Infra-Guard/tree/main/services/api_checker/ventor_qtest 获取。

查看 arXiv 页面 (https://arxiv.org/abs/2608.16391) 查看 PDF (https://arxiv.org/pdf/2608.16391) 添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2608.16391)

在您的智能体中获取此论文:

hf papers read 2608.16391

还没有最新的CLI? curl -LsSf https://hf.co/cli/install.sh | bash

引用此论文的模型 0

无模型链接此论文

在模型的 README.md 中引用 arxiv.org/abs/2608.16391 以从本页链接。

引用此论文的数据集 0

无数据集链接此论文

在数据集的 README.md 中引用 arxiv.org/abs/2608.16391 以从本页链接。

引用此论文的空间 0

无空间链接此论文

在空间的 README.md 中引用 arxiv.org/abs/2608.16391 以从本页链接。

包含此论文的收藏集 0

无收藏集包含此论文

将此论文添加到收藏集 (https://huggingface.co/new-collection) 以从本页链接。

相似文章

大规模安全测试LLM智能体:从风险发现到基于证据的验证

arXiv cs.AI

本文介绍了Vera,一个面向LLM智能体的端到端自动化安全测试框架,它结合了文献驱动的风险发现、安全案例的组合式构建以及基于证据的验证。在四个智能体框架上的评估揭示了显著的安全缺陷,在多通道攻击下平均攻击成功率高达93.9%,同时发布了包含1600个可执行安全案例的Vera-Bench。

LLM-as-a-Verifier:通用验证框架

Hugging Face Daily Papers

LLM-as-a-Verifier引入了一种概率验证框架,该框架从LLM的对数几率计算连续分数,并在粒度、重复评估和标准分解方面进行缩放。它在多个智能体基准测试上取得了最先进的结果,并为强化学习提供了密集反馈。

验证者税:工具使用型LLM智能体中依赖于任务步数的安全与成功权衡 [R]

Reddit r/MachineLearning

本文提出了一个用于工具使用型LLM智能体的安全评估框架,引入了“验证者税(Verifier Tax)”的概念——一种依赖于任务步数的安全与任务完成之间的权衡。文章提出了一种双层验证架构,并使用Tau-bench场景展示了验证如何减少不安全成功,但随着任务步数增加也会降低任务完成率。