LLMs在学术工作流中的应用:对短上下文窗口与长上下文窗口LLMs生成文献综述的评估
摘要
本文评估了使用短上下文窗口和长上下文窗口的大语言模型生成的文献综述,发现较长的上下文能提高信息整合能力,但加剧了重复和描述性过强等问题,因此需要人工监督以确保学术标准。
arXiv:2608.26145v1 Announce Type: new
摘要:我们的研究专注于评估在大语言模型(LLMs)的短上下文和长上下文设置中生成的文献综述,以研究上下文窗口对AI生成文献综述质量的影响,以及AI在支持文献综述写作中的作用。两名研究人员根据Semantic Scholar和Arxiv的研究来源,对二十篇AI生成的文献综述进行了15个维度的评估。我们的发现表明,AI生成的文献综述需要人工监督才能达到学术出版标准。随着上下文窗口的增加,LLMs能够整合更广泛的信息并在较长输入中保持连贯性,但同时也加剧了内容重复、遗漏关键工作以及倾向于描述而非综合等问题。我们的工作表明,AI生成的综述可以提供基础概述,但其输出必须经过领域专家的批判性评估和优化。未来的研究应考虑整合其他LLMs和针对不同领域的微调模型,采用结合人类专业知识与AI能力的混合方法,以解决本研究中指出的局限性。
查看缓存全文
缓存时间: 2026/08/28 09:28
# LLMs用于学术工作流程:基于短与长上下文窗口的大语言模型文献综述评估 来源:https://arxiv.org/abs/2608.26145 查看PDF(https://arxiv.org/pdf/2608.26145) > 摘要:本研究聚焦于评估大语言模型(LLMs)在短上下文与长上下文设置下生成的文献综述,旨在探讨上下文窗口对AI生成文献综述质量的影响,以及AI在辅助文献综述写作中的作用。基于Semantic Scholar和Arxiv的研究资料,两名研究者从15个维度评估了20篇AI生成的文献综述。研究结果表明,AI生成的文献综述需要人工监督以达到学术出版标准。随着上下文窗口增大,LLMs能整合更广泛的信息并在更长的输入中保持连贯性,但同时也会加剧内容重复、遗漏关键研究以及倾向于描述而非综合等问题。本研究表明,AI生成的综述能提供基础性概览,但其输出必须由领域专家进行批判性评估和完善。未来研究应考虑整合不同领域的其他LLMs与微调模型,并采用结合人类专业知识与AI能力的混合方法,以应对本研究指出的局限性。 ## 提交历史 来自:Muhammad Chaudhry 先生 [查看邮件(https://arxiv.org/show-email/464865a0/2608.26145)] **[v1]** 2026年6月28日,星期日,19:03:56 UTC(454 KB)
相似文章
LLM Wiki v2(16分钟阅读)
本文介绍了一种利用LLM构建个人知识库的模式,为在大语言模型辅助下进行知识管理提供了结构化方法。
Review Arcade:论LLM评审的人类对齐与可游戏性
本文利用1000份真实的ACL 2025投稿,研究了LLM生成的评审与人类判断的对齐情况。研究发现,两者的一致性有限,且在不同模型和提示词下存在不稳定性。此外,文章提出了一种无需实质性修改即可人为提高评分的方法。作者建议不应仅依赖LLM评审,并呼吁就其在应对日益增长的投稿量中的作用展开讨论。
LLMs判断能力是否强于生成能力?评估上下文问答中的任务不对称性、机制可解释性与可迁移性
本文测试了LLMs在上下文问答中判断能力优于生成能力的假设,发现在大多数基准上生成准确率超过自我评估,且评估过程对上下文的关注较少。这些发现挑战了自我评估流程中的核心假设。
LLMs 何时真正有效?评估 LLMs 作为数据质量标注器
本研究评估了 LLMs 在电子商务任务中作为数据质量标注器的表现,发现当需要背景知识时,它们优于基线方法,但对于具有强烈词汇信号的任务优势有限,同时展示了跨运行的高度一致性。
大语言模型能否进行具有法律意义的推理?基于欧洲人权法院案例的小规模研究
本小规模研究通过欧洲人权法院案例评估了大语言模型在法律案件预测中的推理能力,发现模型能够生成结构完整但实质浅薄的分析,且基于大语言模型的评估器与人类标注者的一致性较低。