标签
ResearchQA是一个新基准,包含来自八个领域494篇开放获取论文的6,211个单论文问答对,旨在通过要求可验证引用并在证据不足时支持基于理由的拒绝,来评估基于引用的问答能力。
利用语义相似度和时间切片对1100万篇学术论文进行大规模映射,从而分析研究趋势和关联。
本文提出了一种使用公式化表达脱敏的上下文增强Transformer,用于从科学论文中提取问题和方法句子,在两个数据集上分别实现了3.71%和2.67%的宏F1分数提升。
PDFMathTranslate 是一个开源工具,用于翻译科学PDF文件,同时保留数学公式、图表、表格和布局,已被EMNLP 2025接收,并在MIT许可下免费提供。
来自Stanford、CMU、Michigan等37位作者联名的论文提出ARA(Agent原生研究工件)替代传统论文格式,旨在解决叙事税和工程税,让AI Agent能理解、复现和扩展研究。
本文通过实验评估了LLM生成的科学论文评审与人工评审之间的对齐程度,发现对齐有限且变化较大。研究还表明,作者可以通过迭代修改论文来“操控”LLM评审以提高分数,多达35%的论文的总体分数出现了统计显著提升。
本文介绍了ResearchArena,一个用于评估自动研究智能体的框架,并发现虽然智能体生成的论文在仅稿件评审下看似具有竞争力,但结合工件的评审揭示了实验严谨性方面的严重缺陷,没有一篇论文达到顶级会议的接收标准。