通过预注册下一个LLM来减轻基于LLM的p值操纵
摘要
提出一种协议,通过预注册实验并在预注册后第一个符合条件的模型上运行实验,来减轻基于LLM的研究中的p值操纵,并在多个模型上展示了显著的减轻效果。
arXiv:2606.27687v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地被用于生成、分类和注释数据,这些数据的输出用于下游的假设检验。然而,基于LLM的研究容易受到p值操纵的影响:研究人员可以调整提示、解码参数或输出格式,直到达到期望的结果。我们提出了一种协议来减轻基于LLM的研究中的p值操纵:预注册实验和符合条件的模型,然后在预注册后第一个符合条件的LLM上运行实验。研究人员在当前模型上确定最终程序,预注册分析计划以及一组符合条件的未来模型,并在之后发布的第一个符合条件的模型上进行确认性分析。由于该模型在承诺时并不存在,因此无法针对其进行操纵;此外,针对某个模型进行操纵的配置通常不会转移到下一个模型。我们在两个已知真实值的任务上评估了该协议。在来自四个提供商的20个模型和11个LLM分析配置中,该协议将阻止73.9%和72.7%的p值操纵成功转移(在两个任务中)。额外分析表明,在多项压力测试下,减轻效果仍然显著。最后,我们言出必行,遵循了自己的协议并预注册了我们的实验。预注册的实验证实了协议的有效性:在操纵先前模型的7个配置中,有6个配置在之后发布的第一个符合条件的模型上未能成功转移操纵。
查看缓存全文
缓存时间: 2026/06/29 05:23
# 通过预注册下一个LLM来缓解基于LLM的p值操控 来源:https://arxiv.org/abs/2606.27687 查看PDF(https://arxiv.org/pdf/2606.27687) > 摘要:大型语言模型(LLMs)越来越多地被用于生成、分类和标注数据,其输出用于下游假设检验。然而,基于LLM的研究容易被进行p值操控:研究人员可以调整提示、解码参数或输出格式,直到得到期望的结果。我们提出了一种协议来缓解基于LLM的研究中的p值操控:预注册实验和合格模型,然后在预注册后发布的第一个合格LLM上运行实验。研究人员在当前模型上确定最终程序,预注册分析计划以及一组合格的未来模型,并在之后发布的第一个合格模型上进行验证性分析。由于该模型在承诺时并不存在,因此无法针对它进行操控;此外,针对一个模型进行操控的配置通常无法迁移到下一个模型。我们在两个已知真实值的任务上评估了该协议。在来自四个提供商的20个模型和11种LLM分析配置中,该协议在两个任务中分别阻止了73.9%和72.7%的p值操控成功迁移。额外分析表明,在多种压力测试下,缓解效果仍然显著。最后,我们言行一致,遵循自己的协议并预注册了我们的实验。预注册实验证实了该协议的有效性:在7种操控了先前模型的配置中,有6种配置在之后发布的第一个合格模型上未能成功延续操控。 ## 提交历史 来自:Kristina Gligoric [查看邮件(https://arxiv.org/show-email/7fdb3754/2606.27687)] **[v1]** 2026年6月26日星期五 03:31:31 UTC(33 KB)
相似文章
大语言模型能泄露训练数据,但它们愿意吗?对LLM记忆的倾向性感知评估
PropMe是一个倾向性感知框架,用于评估LLM的记忆,区分强制复现能力和自然倾向,使用SimpleTrace在开放模型和数据集上进行确定性归因。
基于LLM的科学同行评审:方法、基准与可靠性挑战
本综述从系统层面对基于LLM的科学同行评审进行了分析,涵盖方法、基准以及包括提示注入和数据投毒等稳健性风险在内的可靠性挑战。
TEMPO:通过模式分离策略优化实现时间强制,用于可信的大语言模型回测
提出TEMPO,一种策略优化方法,通过使用双模式奖励和基于GRPO的训练,训练大语言模型仅依据截止日期前的信息进行推理,将知识泄露降低2–13%,同时将任务性能提升6–13%。
行动之前:面向前瞻性假设发现的LLM基准测试
本文介绍了HypoArena,这是一个用于评估LLMs从非完整证据中主动构建假设空间能力的基准,在15个前沿LLM上的实验揭示了能力分层。
代理探索与可复用引导:通过代理引导更新信号的模块化LLM后训练范式
提出PUST,一种新颖的LLM后训练框架,该框架通过轻量级代理模型将奖励探索与分布对齐解耦,从而实现可复用的更新信号以及跨模型的高效弱到强增强。