ActReview:基于反驳引导的训练数据与评分奖励,用于可操作同行评审生成
摘要
ActReview 是一个基于反驳引导的后训练框架,通过利用作者回复作为监督信号,生成同行评审的诊断性主张和修改建议,并配备一个由人工精心策划的基准测试集用于评估。
查看缓存全文
缓存时间: 2026/09/11 18:19
论文页面 - ActReview:基于反驳引导的训练数据与评分标准奖励,实现可操作的同行评审生成
来源:https://huggingface.co/papers/2609.09076
摘要
ActReView 是一个反驳引导的后训练框架,通过利用作者回复作为潜在监督信号,生成诊断性论断和具体的修改建议,用于同行评审。
随着大语言模型越来越多地用于投稿前的自我评审,对于不仅能够指出弱点,还能指导作者进行具体修改的反馈需求日益增长。我们将此任务称为可操作的同行评审生成(https://huggingface.co/papers?q=Actionable%20Peer-review%20Generation),并将其分解为两个子任务:诊断性论断生成(https://huggingface.co/papers?q=diagnostic%20claim%20generation)和修改建议生成(https://huggingface.co/papers?q=revision%20suggestion%20generation)。我们引入了ActReView(https://huggingface.co/papers?q=ActReview),一个反驳引导的后训练(https://huggingface.co/papers?q=rebuttal-guided%20post-training)框架,将针对论文的诊断与具体的、基于证据的修改计划联系起来。我们的核心见解是,作者的反驳揭示了回应审稿人疑虑的可行操作,因此可以为面向修改的反馈提供潜在监督。从OpenReview上真实的评审-反驳对话线程出发,我们通过将审稿人指出的弱点与作者的回复对齐,并将生成的反馈植根于论文的局部证据中,构建了ActReview-40K(https://huggingface.co/papers?q=ActReview-40K)数据集。我们使用多任务监督微调(https://huggingface.co/papers?q=multi-task%20supervised%20fine-tuning)对Qwen3-8B-Base模型进行后训练,随后使用基于候选感知、针对弱点的评分标准奖励进行GRPO(https://huggingface.co/papers?q=GRPO)优化。我们还引入了ActReView-Bench(https://huggingface.co/papers?q=ActReview-Bench),这是一个由人工策划的包含1000个实例的基准测试,用于评估诊断质量和修改实用性。实验表明,ActReView(https://huggingface.co/papers?q=ActReview)在可操作性和证据关联性方面优于先前的专业评审生成模型,同时与强大的基于提示的大语言模型保持竞争力。人类评估证实了其修改实用性的提升,但也揭示了在技术准确性方面仍存在差距,额外的分析支持其推广到未见过的论文以及在不同评审者间的稳健性。
查看 arXiv 页面 (https://arxiv.org/abs/2609.09076)查看 PDF (https://arxiv.org/pdf/2609.09076)GitHub 仓库 (https://github.com/Yiling-Ma/ActReview)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2609.09076)
获取此论文到你的代理工具:
hf papers read 2609\.09076
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型 (0)
没有模型链接此论文。
在模型的 README.md 中引用 arxiv.org/abs/2609.09076 以从此页面链接到它。
引用此论文的数据集 (0)
没有数据集链接此论文。
在数据集的 README.md 中引用 arxiv.org/abs/2609.09076 以从此页面链接到它。
引用此论文的 Space (0)
没有 Space 链接此论文。
在 Space 的 README.md 中引用 arxiv.org/abs/2609.09076 以从此页面链接到它。
包含此论文的收藏 (0)
没有收藏包含此论文。
将此论文添加到收藏 (https://huggingface.co/new-collection) 以从此页面链接到它。
相似文章
RubricReviewer:从直接批判到客观全面的基于评分标准的同行评审
介绍了RubricReviewer,一个用于基于大语言模型(LLM)的同行评审的评分标准驱动框架,它显式生成论文自适应的评分标准,并将无训练的证据收集智能体(Scout)与经过训练的人类对齐模型(Aligner)相结合,以产生更全面、更具区分性和更鲁棒的评审意见。
作者在环响应生成与评估:将作者专业知识和意图整合到同行评审回复中
本文介绍了Re3Align数据集、REspGen框架和REspEval评估套件,用于同行评审中的作者在环响应生成,整合了作者专业知识和意图信号。该工作填补了NLP在科学反驳文章表述中的空白,提供了全面的数据集、可控的生成框架和多维度评估指标。
Co-ReAct:将评分标准作为 ReAct 代理的步骤级协作工具
Co-ReAct 引入了一种基于评分标准的动作选择框架,在推理过程中将评分标准作为 ReAct 代理的步骤级指导,提高了轨迹质量,并在 DeepResearchBench 和 SQA-CS-V2 上超越了基线模型。
InternReviewer & InternAdvocate:同行评审与回应中智能体强化学习的客观奖励与评估
本文介绍了InternReviewer和InternAdvocate,这是一个利用智能体强化学习与客观奖励,在学术同行评审与回应中开发AI智能体的框架,旨在提升推理深度、引用准确性并减少幻觉。
对抗性评审(Adversarial Review):基于结构化分歧的实证智能代理代码评审
本文介绍了对抗性评审(AR),一种用于智能代理代码评审的最小协作协议,它利用结构化分歧来提升仓库级编码任务的性能,在LiveCodeBench和SWE-bench等基准测试中,以更少的代理超越了基线方法。