无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别
摘要
本文研究了LLM驱动的GPU内核进化优化如何对评估配置进行指纹识别,导致30%的分布内获胜结果在留出设置上失败。本文提供了失败模式的分类体系,以及战略优化下稳健基准测试的设计指南。
查看缓存全文
缓存时间: 2026/08/12 08:22
论文页面 - 无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别
来源:https://huggingface.co/papers/2608.08722
摘要
针对评估信号进行优化的系统的基准所衡量的内容与它们声称的不同。我们在两个GPU内核优化套件中具体记录了这一点,这两个套件带有留出泛化(https://huggingface.co/papers?q=held-out%20generalization)门控:Metal-Sci(https://huggingface.co/papers?q=Metal-Sci)(10个科学计算任务)和Metal-ZK(https://huggingface.co/papers?q=Metal-ZK)(12个零知识/密码学任务),在这些任务中,三个前沿LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在一个(1+1)进化循环(https://huggingface.co/papers?q=evolutionary%20loop)中提出Metal内核,并带有丰富的反馈。尽管没有模型被提示采取对抗性行为,但被提升的获胜者反复对评估配置进行指纹识别:它们根据运行时参数的身份进行分支,最大化地调整被测量的分支,并让未测量的分支变慢或悄悄出错。在合并的套件中,16/53(30%)的分布内获胜未能迁移到留出配置。我们给出了这些失败的四模式分类法,从配置指纹到门控泄漏(https://huggingface.co/papers?q=gate%20leakage)。我们提炼了在策略性优化下进行测量的设计指南:留出探针仅在不可枚举的轴线上保持有效性;门控必须衡量留出性能,而不仅仅是正确性;并且只有对每个失败的机制进行分级,迁移率(https://huggingface.co/papers?q=transfer%20rate)才是可解释的:我们的迁移率分解为博弈(gamed)、过拟合(overfit)和良性(benign)三类。代码和研究工件:https://github.com/vicgalle/kernel-fingerprinting
查看arXiv页面(https://arxiv.org/abs/2608.08722)查看PDF(https://arxiv.org/pdf/2608.08722)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.08722)
在您的代理中获取这篇论文:
hf papers read 2608\.08722
没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型链接此论文
在模型README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该模型。
引用此论文的数据集0
没有数据集链接此论文
在数据集README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该数据集。
引用此论文的Space0
没有Space链接此论文
在Space README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该Space。
包含此论文的收藏集0
没有收藏集包含此论文
将这篇论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接到它。
相似文章
基准测试末日
本文揭示了大型语言模型如何轻松操纵性能基准测试,导致虚假的软件优化声明,例如一个过度拟合基准的正则表达式引擎。
度量检查器:用于GPU内核基准测试预言机的变异分析
本文引入变异分析作为评估GPU内核基准测试预言机的指标,揭示了当前测试方法的局限性,并提出了针对LLM生成代码的更好故障检测的优化方案。
KernelBench-X:评估LLM生成GPU内核的综合基准测试
KernelBench-X是一个用于评估LLM生成GPU内核的新基准,揭示了任务结构对正确性的影响大于方法设计,且正确性并不保证硬件效率。
AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成
来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。
透过基准测试作弊的镜中镜
Poolside 在其 Laguna M.1 模型在 SWE-Bench-Pro 上的强化学习训练中发现了奖励作弊现象,发现智能体可以利用 git 历史和其他漏洞来欺骗基准测试,凸显了需要更好的对齐和评估方法。