RAP:研究注意力预测揭示目标条件证据获取偏差
摘要
本文介绍了研究注意力预测(RAP),这是一个用于评估大型语言模型(LLMs)预测未来研究注意力转变的基准,揭示了证据获取策略中的偏差。
arXiv:2609.10092v1 公告类型:新
摘要:大型语言模型(LLMs)越来越多地充当研究代理,但其追踪研究注意力转变的能力难以评估,因为综述和研究想法缺乏唯一可验证的结果。我们引入了研究注意力预测(RAP),这是一个滚动基准,涵盖278个AI/ML领域和1,390个片段。在每个截止点,LLM代理搜索一个时间受限的arXiv语料库,并预测未来六个月内八个冻结研究方向的论文份额。搜索通常有帮助,但在组合准确性上,所有四个诊断模型的表现都比精确计数的指数加权移动平均(EWMA)基线差。我们识别出两个相互关联的瓶颈。在累积历史访问下,状态前向传递在所有四个诊断模型上都优于直接预测;冻结证据重放将此反转的一个共享组成部分与面向预测的策略检索到较少近期证据联系起来。即使有精确的历史活动,未来特定更新仍然有限,只有GPT-5.5加上重新开放的搜索略微超过EWMA。在实现结果上的微调使Qwen3-4B的预测Spearman相关系数在后期起源的保留字段上提高了0.105,在变化丰富的片段上也获得了收益。
查看缓存全文
缓存时间: 2026/09/11 08:43
# 研究注意力预测揭示目标导向的证据获取偏差 来源:https://arxiv.org/html/2609.10092 梁景聪 王思远 尹振飞 Philip Torr 余俊池††通讯作者。 魏仲宇¹¹脚注标记:1 ###### 摘要 大语言模型(LLM)正日益成为研究智能体,但由于研究综述和研究观点缺乏可唯一验证的结果,其追踪研究注意力转移的能力难以评估。本文引入**研究注意力预测(RAP)**,一个覆盖278个人工智能/机器学习领域、包含1390个事件的滚动基准测试。在每个截止时间点,LLM智能体检索时间受限的arXiv语料库,并预测未来六个月内八个固定研究方向的论文占比。检索通常有所帮助,但所有四个诊断模型在组合准确性上均表现逊于精确计数的指数加权移动平均(EWMA)基线。我们识别出两个关联的瓶颈:在累积历史访问模式下,状态延续对所有诊断模型的预测效果优于直接预测;冻结证据重放分析揭示了该逆转现象的一个共同成因,即面向预测的策略检索到的近期证据比例较低,尽管近期证据对预测目标更有价值。即使拥有精确的历史活动数据,针对未来的更新能力仍然有限,仅有GPT-5.5配合重新开放的检索略超EWMA基线。基于实际结果的微调使Qwen3-4B在后期起始点的独立测试领域的斯皮尔曼相关性提升了0.105,在变化丰富的事件上也有增益。 1复旦大学 2上海创新研究院 3香港中文大学 4牛津大学 [email protected], [email protected], [email protected] ## 1 引言 大语言模型(LLM)正迅速从聊天机器人演变为支持科学工作流的研究助手(Baek等, 2025 [https://arxiv.org/html/2609.10092#bib.bib4];Lu等, 2024 [https://arxiv.org/html/2609.10092#bib.bib22])。近期研究表明,LLM已经能够检索文献,并从数百篇论文中生成研究领域的综合综述(Asai等, 2026 [https://arxiv.org/html/2609.10092#bib.bib2];Skarlinski等, 2024 [https://arxiv.org/html/2609.10092#bib.bib27];Wang等, 2024b [https://arxiv.org/html/2609.10092#bib.bib35])。除了总结现有知识,高效的研究助手还应追踪研究注意力的演变。这一能力至关重要,因为许多研究活动——如识别新兴主题、优先安排科学探索、支持研究规划——都依赖于理解当前研究格局并预判未来研究重点可能集中的方向(Clauset, Larremore, and Sinatra, 2017 [https://arxiv.org/html/2609.10092#bib.bib10];Fortunato等, 2018 [https://arxiv.org/html/2609.10092#bib.bib11])。 图注:图1:与文献综述(调查和总结特定领域现有科学记录)不同,**研究注意力预测(RAP)** 预测该领域近期(例如六个月内)的科学活动分布。 现有评估提供了关于此能力的两种片面视角。回顾性任务评估对已发表工作的综合能力(Asai等, 2026 [https://arxiv.org/html/2609.10092#bib.bib2];Skarlinski等, 2024 [https://arxiv.org/html/2609.10092#bib.bib27];Wang等, 2024b [https://arxiv.org/html/2609.10092#bib.bib35]),但流畅的综述并不能证明在特定截止时间点推断的领域状态在数量上是准确的。前瞻性基准测试将预测与后续科学成果进行比较(Krenn等, 2023 [https://arxiv.org/html/2609.10092#bib.bib17];Luo等, 2025 [https://arxiv.org/html/2609.10092#bib.bib23];Ajith等, 2026 [https://arxiv.org/html/2609.10092#bib.bib1];Wu等, 2026 [https://arxiv.org/html/2609.10092#bib.bib36]),但通常只关注单篇论文、发现或影响力。两者均未评估在相同的冻结领域方向框架下,对联合归一化的活动分布进行重复、智能体化的预测。因此我们提出:*LLM智能体能否基于过去的科学记录预测未来的研注意力?* 表1:科学预测目标比较。RAP预测在固定领域方向框架下的滚动联合分布。 为此,我们引入**研究注意力预测(RAP)**,一个针对此问题的滚动、基于结果的分布预测基准(图1 [https://arxiv.org/html/2609.10092#S1.F1])。在每个截止时间点,智能体预测未来六个月内首次提交的论文将如何分布在一个固定的、特定领域的方向代码簿中,检索范围限于更早的文献。RAP包含278个AI/ML领域、五个半年度起始点,以及从356,357篇AI/ML方向arXiv论文构建的1390个事件。使用首次提交日期定义历史证据和未来结果,可在滚动预测起始点进行基于时间的评估。在每个起始点使用相同的冻结方向代码簿评估每个领域,使得产生的活动分布在时间上可直接比较。RAP将研究注意力操作化为论文首次提交至arXiv在稳定、特定领域方向上的相对分布。它不衡量科学重要性、新颖性或价值。 为分解端到端预测过程,我们比较了无检索(Closed)、前六个月检索(Fixed-window)和截止时间前全量检索(Expanding-history),以及一个匹配的“状态查询”(其延续作为智能体特定的持久性控制)。我们将截止时间后的预测声明保留给每个模型文档知识截止时间后的目标窗口(Cheng等, 2024 [https://arxiv.org/html/2609.10092#bib.bib9];Li等, 2026 [https://arxiv.org/html/2609.10092#bib.bib21])。 评估揭示了一个广泛的能力差距:检索通常优于无检索,但没有自然的智能体条件能超越精确计数的指数加权移动平均(EWMA)基线,尽管截止时间前的活动包含了可测量的、关于未来偏离持续性的信号。此外,分阶段诊断揭示了两个关联的瓶颈。在扩展历史条件下,状态延续在所有四个诊断模型中都优于直接预测。冻结证据重放将此逆转的一个共同成分归因于获取:面向预测的策略将检索证据中较小的比例分配给最近六个月的窗口,尽管它对未来目标更有用。因此,要求智能体展望未来,可能会在改变其输出之前,改变其关注的内容。即使拥有精确的历史记录,针对未来的更新能力仍然有限;只有GPT-5.5配合重新开放的检索略超EWMA基线。然而,与结果对齐的微调使Qwen3-4B在来自依赖不重叠的测试领域的后期起始点事件上提升了+0.105,证明了RAP内的跨领域适应性,但未修复已识别的获取失败。 我们的贡献是: - • **滚动基准**。覆盖278个领域、1390个基于结果的事件,具有冻结的代码簿、与截止时间对齐的证据和依赖感知的评估。 - • **能力分解**。匹配的证据条件、状态延续、重放和精确历史干预,将获取、状态恢复和未来更新分离开来。 - • **检索失败与可学习性**。在四个LLM智能体中,预测将累积历史检索推离近期证据;与结果对齐的微调证明了任务内的可学习性,但未建立机制层面的修复。 ## 2 相关工作 ##### 基于结果的科学预测。科学预测涵盖总体趋势和单个制品。早期的科学计量工作建模主题演变和新兴领域(Griffiths and Steyvers, 2004 [https://arxiv.org/html/2609.10092#bib.bib12];Blei and Lafferty, 2006 [https://arxiv.org/html/2609.10092#bib.bib7];Chen, 2006 [https://arxiv.org/html/2609.10092#bib.bib8];Small, 2006 [https://arxiv.org/html/2609.10092#bib.bib28]),预测领域或子领域的活动与主题流行度(Taşkın, 2021 [https://arxiv.org/html/2609.10092#bib.bib30];Asooja等, 2016 [https://arxiv.org/html/2609.10092#bib.bib3];Ofer, Kaufman, and Linial, 2024 [https://arxiv.org/html/2609.10092#bib.bib25]),并预测科学图谱中的未来链接或高影响力概念(Krenn等, 2023 [https://arxiv.org/html/2609.10092#bib.bib17];Gu and Krenn, 2025 [https://arxiv.org/html/2609.10092#bib.bib13];Marwitz等, 2026 [https://arxiv.org/html/2609.10092#bib.bib24])。近期的基准测试预测实验结果或科学事件(Luo等, 2025 [https://arxiv.org/html/2609.10092#bib.bib23];Wu等, 2026 [https://arxiv.org/html/2609.10092#bib.bib36])、未来论文组成部分和影响力(Ajith等, 2026 [https://arxiv.org/html/2609.10092#bib.bib1])、研究判断(Tian等, 2026 [https://arxiv.org/html/2609.10092#bib.bib31])或想法和提案的未来对齐(Jiang, 2026 [https://arxiv.org/html/2609.10092#bib.bib15];Wang等, 2026 [https://arxiv.org/html/2609.10092#bib.bib32])。RAP则预测在自适应证据获取下,基于冻结代码簿的滚动、联合归一化的领域级分布,并将预测与匹配的状态干预配对,以分离目标导向的搜索与终端输出。 ##### 时间评估与预测。时间评估推动了时间敏感和动态构建的测试(Lazaridou等, 2021 [https://arxiv.org/html/2609.10092#bib.bib18];Li, Guerin, and Lin, 2024 [https://arxiv.org/html/2609.10092#bib.bib20];Karger等, 2025 [https://arxiv.org/html/2609.10092#bib.bib16]);报告的截止时间可能与实际不同,而通过提示模拟无知是不可靠的(Cheng等, 2024 [https://arxiv.org/html/2609.10092#bib.bib9];Li等, 2026 [https://arxiv.org/html/2609.10092#bib.bib21])。RAP遵循滚动起始点实践,与持续性、指数平滑和无变化参考进行比较(Hyndman and Athanasopoulos, 2021 [https://arxiv.org/html/2609.10092#bib.bib14];Beck, Dovern, and Vogl, 2025 [https://arxiv.org/html/2609.10092#bib.bib6]),并将其目标视为一个组合份额向量(Snyder等, 2017 [https://arxiv.org/html/2609.10092#bib.bib29])。 ##### 研究智能体与文献综合。基于文献的发现和PaperRobot建立了更早的文献驱动关联和想法生成路线(Sebastian, Siew, and Orimaye, 2017 [https://arxiv.org/html/2609.10092#bib.bib26];Wang等, 2019 [https://arxiv.org/html/2609.10092#bib.bib34])。现代系统支持基于检索的综合(Asai等, 2026 [https://arxiv.org/html/2609.10092#bib.bib2];Skarlinski等, 2024 [https://arxiv.org/html/2609.10092#bib.bib27])、自动化综述(Wang等, 2024b [https://arxiv.org/html/2609.10092#bib.bib35];Yan等, 2025 [https://arxiv.org/html/2609.10092#bib.bib38];Bao等, 2025 [https://arxiv.org/html/2609.10092#bib.bib5])以及想法或提案生成(Li等, 2025 [https://arxiv.org/html/2609.10092#bib.bib19];Baek等, 2025 [https://arxiv.org/html/2609.10092#bib.bib4];Wang等, 2024a [https://arxiv.org/html/2609.10092#bib.bib33]),而“The AI Scientist”将此工作流程扩展到执行、起草和评审(Lu等, 2024 [https://arxiv.org/html/2609.10092#bib.bib22])。这些评估强调最终制品(Xu等, 2025 [https://arxiv.org/html/2609.10092#bib.bib37]);RAP则固定领域、截止时间、证据范围、接口和代码簿,同时改变状态与预测,从而能够控制比较证据获取和终端输出。 ## 3 研究注意力预测 RAP结合了冻结的测量工具与滚动的检索和预测协议。我们首先构建稳定的特定领域坐标和结果标签,然后在时间受限的证据访问下评估智能体。我们使用“模型”指代底层的LLM,使用“智能体”指代其实例化的RAP提示、检索接口和输出协议。图2([https://arxiv.org/html/2609.10092#S3.F2])说明了RAP的构建和评估。 图注:图2:研究注意力预测(RAP)的构建与评估。 (a) 开放式领域提取、归一化和成员扩展,将一个冻结的AI/ML方向arXiv子集转换为重叠的特定领域语料库。 (b) 2024年前的成员身份被独立组织成候选代码簿,并合并为一个冻结的、恰好包含八个操作性研究方向的特定领域框架;展示了一个示例。 (c) 一个日期盲的分配工具将每个论文-领域成员身份映射到一个方向或“其他”;在连续的六个月窗口内汇总分配结果,产生实现的滚动目标,“其他”不包含在八路归一化中。 (d) 在截止时间点T,智能体接收领域和其代码簿,并在闭合、固定窗口或扩展历史证据访问条件下预测下一窗口的方向份额。预测使用事件级的斯皮尔曼一致性与实现分布进行评分。 ### 3.1 基准构建 测量工具包括重叠的特定领域语料库、每个领域2024年前的方向代码簿,以及在每个滚动起始点应用的日期盲分配规则。 ##### 特定领域语料库。 从356,357篇于2022-06-01至2026-06-30期间首次提交、并标注至少一个cs.CL、cs.LG、cs.AI或cs.CV标签的arXiv论文出发,一个开放式结构化提取器(一个由Claude Sonnet 4.6蒸馏而来的Qwen3.5-4B学生模型)为每篇论文提议一个领域标签。标签经过归一化,通过与标签级和文档级原型匹配进行扩展,并保守合并。保留那些在2026-01-01前至少有300次论文-领域成员关系的领域,得到281个重叠语料库;其中278个接受有效的方向代码簿,包含578,745次论文-领域成员关系,涉及279,365篇唯一论文;这些操作性领域并未划分AI/ML。领域资格是事后冻结的,但代码簿构建仅使用2024年前的证据,并且每个评估事件仅暴露T时间点前的论文。构建细节和抽样框敏感性在附录中报告。 ##### 冻结的方向代码簿。 仅使用2024年前的证据,GPT-5.5和Claude Opus 4.6独立起草特定领域的候选代码簿。其匿名联合版本由GPT-5.5修订和合并,形成恰好八个操作性方向。每个方向都有名称、定义、包含和排除边界以及2024年前的示例。由此产生的代码簿在起始点之间是冻结的。其方向是操作性坐标,而非该领域的详尽分类。 ##### 时间不变分配与滚动目标。 对于领域f,令D_f = {d₁, …, d₈}表示其冻结的方向。一个日期盲分类器使用每篇论文的标题和摘要以及书面代码簿,将其分配到D_f中的一个主标签或“其他”。在每个起始点使用相同的规则。对于预测起始点T和方向d ∈ D_f,令n_{f,T,d}表示在领域f中具有成员关系、首次提交于T时间点之后且在T+6个月之前、并被分配主标签d的论文数量。实现的目标份额为 y_{f,T,d} = n_{f,T,d} / Σ_{d′∈D_f} n_{f,T,d′},其中d′∈D_f。
相似文章
学习重点:使用因果证据集监督稀疏注意力路由
本文测试了注意力权重能揭示模型输出实际依赖内容的假设,发现注意力与因果依赖常不一致。作者提出将干预掩码获得的因果证据集作为稀疏注意力路由器的监督信号,在注意力蒸馏路由器失败的检索任务上实现了近乎完美的准确率。
真实场景下的对比归因:针对现实基准中大模型失效的可解释性分析
研究者采用基于LRP的对比归因方法,分析大模型在现实基准中失败的原因,发现该方法在某些场景下能提供有用信号,但并非始终可靠。
Softmax丢弃了什么:用于证据积累的Mass-Aware注意力
本文提出了Mass-Aware Attention(MAA),这是标准注意力归一化的一种泛化,通过在重复情况下以不同速率缩放分子和分母来保留证据积累信息,从而提高了表示的信息量,并在时序图及其他领域提升了任务性能。
是时候 REFLECT 了:我们能信任 LLM 评判者来评估基于证据的研究代理吗?
本文介绍了 REFLECT,这是一个用于评估 LLM 评判者在深度研究代理评估中可靠性的元评估基准。实验表明,当前的 LLM 评判者仍然不可靠,在推理、工具使用和报告质量失败方面的整体准确率低于 55%。
结构注意力税:检索格式如何独立于内容劫持上下文学习
本文识别并形式化了'结构注意力税'现象,即检索内容的格式(例如知识图谱三元组)独立于语义相关性扭曲了LLM的注意力分布,导致演示注意力压缩。它提供了正式框架、跨模型和基准的实证证据,并提出了结构感知的缓解策略。