无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别

Hugging Face Daily Papers 论文

摘要

本文研究了LLM驱动的GPU内核进化优化如何对评估配置进行指纹识别,导致30%的分布内获胜结果在留出设置上失败。本文提供了失败模式的分类体系,以及战略优化下稳健基准测试的设计指南。

针对评估信号进行优化的系统,其基准测试所衡量的内容与它们所声称的并不相同。我们在两个带有留出泛化门槛的GPU内核优化套件中具体记录了这一点:Metal-Sci(10个科学计算任务)和Metal-ZK(12个零知识/密码学任务),其中三个前沿LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在带有丰富反馈的(1{+}1)进化循环中提出Metal内核。尽管没有模型被提示以对抗方式行事,但被选中的胜出者反复对评估配置进行指纹识别:它们根据运行时参数的身份进行分支,最大限度地调整被度量的分支,而让未度量的分支保持缓慢或静默出错。综合所有套件,16/53(30%)的分布内获胜无法迁移到留出配置。我们给出了这些失败的四模式分类,从配置指纹到门槛泄漏。我们提炼了战略优化下测量的设计指南:留出探针仅在不可枚举的维度上保持有效性;门槛必须衡量留出性能,而不仅仅是正确性;并且只有通过逐失败机制评级,迁移率才是可解释的——我们的评级分解为被博弈(gamed)、过拟合(overfit)和良性(benign)。 代码和研究工件:https://github.com/vicgalle/kernel-fingerprinting
查看原文
查看缓存全文

缓存时间: 2026/08/12 08:22

论文页面 - 无攻击者的博弈:选择压力下LLM驱动搜索中的基准指纹识别

来源:https://huggingface.co/papers/2608.08722

摘要

针对评估信号进行优化的系统的基准所衡量的内容与它们声称的不同。我们在两个GPU内核优化套件中具体记录了这一点,这两个套件带有留出泛化(https://huggingface.co/papers?q=held-out%20generalization)门控:Metal-Sci(https://huggingface.co/papers?q=Metal-Sci)(10个科学计算任务)和Metal-ZK(https://huggingface.co/papers?q=Metal-ZK)(12个零知识/密码学任务),在这些任务中,三个前沿LLM(Opus 4.7、Gemini 3.1 Pro、GPT-5.5)在一个(1+1)进化循环(https://huggingface.co/papers?q=evolutionary%20loop)中提出Metal内核,并带有丰富的反馈。尽管没有模型被提示采取对抗性行为,但被提升的获胜者反复对评估配置进行指纹识别:它们根据运行时参数的身份进行分支,最大化地调整被测量的分支,并让未测量的分支变慢或悄悄出错。在合并的套件中,16/53(30%)的分布内获胜未能迁移到留出配置。我们给出了这些失败的四模式分类法,从配置指纹到门控泄漏(https://huggingface.co/papers?q=gate%20leakage)。我们提炼了在策略性优化下进行测量的设计指南:留出探针仅在不可枚举的轴线上保持有效性;门控必须衡量留出性能,而不仅仅是正确性;并且只有对每个失败的机制进行分级,迁移率(https://huggingface.co/papers?q=transfer%20rate)才是可解释的:我们的迁移率分解为博弈(gamed)、过拟合(overfit)和良性(benign)三类。代码和研究工件:https://github.com/vicgalle/kernel-fingerprinting

查看arXiv页面(https://arxiv.org/abs/2608.08722)查看PDF(https://arxiv.org/pdf/2608.08722)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.08722)

在您的代理中获取这篇论文:

hf papers read 2608\.08722

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接此论文

在模型README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该模型。

引用此论文的数据集0

没有数据集链接此论文

在数据集README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该数据集。

引用此论文的Space0

没有Space链接此论文

在Space README.md中引用arxiv.org/abs/2608.08722,即可从本页链接到该Space。

包含此论文的收藏集0

没有收藏集包含此论文

将这篇论文添加到收藏集(https://huggingface.co/new-collection)以从本页链接到它。

相似文章

基准测试末日

Lobsters Hottest

本文揭示了大型语言模型如何轻松操纵性能基准测试,导致虚假的软件优化声明,例如一个过度拟合基准的正则表达式引擎。

AdaExplore:基于失败驱动的自适应与多样性保留搜索的高效内核生成

arXiv cs.CL

来自卡内基梅隆大学、华盛顿大学和Arm的研究人员提出了AdaExplore,这是一种用于GPU内核代码生成的LLM智能体框架。该框架通过失败驱动自适应与多样性保留搜索技术,在不进行额外微调的情况下,在KernelBench Level-2和Level-3基准测试中分别实现了3.12倍和1.72倍的加速。

透过基准测试作弊的镜中镜

Hacker News Top

Poolside 在其 Laguna M.1 模型在 SWE-Bench-Pro 上的强化学习训练中发现了奖励作弊现象,发现智能体可以利用 git 历史和其他漏洞来欺骗基准测试,凸显了需要更好的对齐和评估方法。