标签
介绍了一种名为Uncheatable Eval的动态基准测试方法,该方法利用压缩率评估语言模型性能,并能有效缓解数据污染问题。
本文测量了AI代理如何污染其写入的存储,识别了错误传播的阈值,并使用合成和真实世界的Wikidata数据验证了发现。
一条推文讨论了关于AI基准测试被包含在训练数据中的担忧,Simon Willison分享了一个相关的电影冷知识。
本文表明,基准污染会提高大型语言模型的绝对分数,但很少改变排行榜排名。通过使用一种控制释义的措施,表明污染在公共模型中大体上是均匀的。
本文提出CalibDCD,一种用于基于特征的LLM数据污染检测的校准框架,可缓解后训练引起的特征偏移,检测性能最高提升7.0% AUC和15.0% TPR@5%FPR。
介绍了Cultivar,一个对比性本地化翻译基准,用于检测数据污染并评估多语言翻译模型的本地化鲁棒性。该基准对32个开放权重模型进行了评测,发现机器翻译专用模型的鲁棒性较低,且可能对FLORES存在过拟合。
本文评估了LLM在理解和生成新型中文歇后语谜语方面的表现,发现像Gemini 3.1 Pro这样的模型虽然因记忆而在理解上表现出色,但在创造性生成方面却逊于人类,凸显了数据污染问题和推理能力的局限性。
CursorBench 显示,Grok 4.5 的高分部分是由于在训练数据中无意包含了 Cursor 代码库的早期快照。相关数据已从未来的模型中移除。
详细解释了为什么在基准测试、评估集或测试集上进行训练是机器学习中的大忌,这会破坏衡量泛化能力的能力。文章强调了干净的评估协议的重要性,并警告不要进行“benchmaxxing”。
本文提出了基于回忆的提示策略(Self-Recall和Question-Recall),以提升LLM对知识截止的遵循能力,在反事实问题上优于现有方法,并引入多截止历史事件基准(MHEB)用于鲁棒性评估。
LaRA是一个逐层表示分析框架,通过测量模型各层的几何偏差来检测RL后训练LLM中的数据污染,优于输出级基线。
本文介绍了TSFMAudit,这是首个用于审计时间序列基础模型预训练数据污染的方法,通过探针适应动态来检测异常高效的微调,从而指示先前的数据暴露。
统一综述大语言模型中的预训练数据暴露(PDE),涵盖成员推理、数据污染和安全影响,并回顾了攻击与防御方法。
提出联合包络符合选择(JECS),一种用于多模型基准去污的符合程序,可证明地控制全局污染率,同时保持比基线更高的统计功效。
本文提出Zero-CoT探针(ZCP),一种黑盒检测方法,通过截断思维链推理并比较扰动数据集上的性能来识别LLM中的规避性数据污染,实现了对直接和间接污染的强大检测。
本文研究了基于LLM的生成式错误修正(GER)在低资源西弗里斯兰语ASR中的应用,采用污染感知评估方法,使用私有数据集表明GPT-5.1将错误降低至低于oracle水平。
本文实证研究了LLMs在税法中的法律推理,表明数据污染会夸大性能,而神经符号混合系统比单体LLMs提供更可靠和稳健的泛化能力。
Hugging Face 宣布向 Open ASR Leaderboard 引入来自 Appen 和 DataoceanAI 的私有高质量数据集,以防止 benchmaxxing 和测试集污染,同时保留公开数据用于默认的平均 WER 计算。