标签
CrossAudit引入了一种基于Git的协议,用于审计使用不同供应商AI代理的自主研究流程,以确保智能体科学中的监督和完整性。
本研究评估了两个多模态大型语言模型作为ICLR 2026投稿的同行评审,发现评分校准高但错误检测低,作者身份无影响,而图表降低了错误检测。
一项复制研究未能重现一篇2022年关于拖延症与截止日期的论文发现,引发对原始有影响力研究数据欺诈的指控。
本文介绍了IntegrityBench,一个用于评估LLM在机构压力下作为共同科学家时是否维护研究诚信的基准。研究发现,在峰值压力下,前沿模型在约三分之一的诚信关键决策中失败,且道德行为并不需要准确的不当行为分类。
一条吐槽ICLR 2026论文的推文,指出某篇开源论文效果极好,但实际是用测试集标签来选参数,质疑顶会审稿不严。
A position paper arguing that autonomous AI agents in science widen the verification gap and that scientific verification infrastructure must evolve with observable-by-default workflows, scalable verification, and clear attribution to sustain trustworthy science.
一项研究测量了ArXiv上AI撰写文本的普遍程度,发现超过30%的新提交读起来像机器撰写,其中计算机科学领域高达65%,数学领域最低仅为0.7%。
本文认为,生成式人工智能可能通过侵蚀形成学术判断和信任的实践来降低研究质量,并倡导重新致力于将研究视为一种不可自动化的活生生的实践。
施普林格·自然撤回了由马克斯·普朗克研究所研究人员进行的两项研究,理由是对研究结果的有效性存在担忧。
一期播客节目探讨了学术论文中日益增多的AI幻觉现象,将其归因于学者们恶劣的工作条件,并警告这可能对未来研究及知识生产构成威胁。
数学家通过国际数学联盟认可的《莱顿宣言》警告,人工智能威胁数学研究的核心价值,包括正确性、透明度和引用规范,同时引发对行业影响力和传统标准被侵蚀的担忧。
普林斯顿大学的一项研究发现,在17个领域的近300篇AI论文中存在数据泄露问题,导致结果过于乐观。作者强调了意外泄露数据的容易程度,并提醒不要轻信那些令人印象深刻的AI声明而不检查是否存在泄露。
ArXiv正在实施一项新政策:如果提交的论文显示出未加管控的AI生成证据,例如虚假引用或LLM评论,将禁止作者发表论文一年,并强调作者对内容负全责,无论内容如何生成。
本文批评了依赖大语言模型生成参考文献条目的做法,指出了学术论文中幻觉引用和作者列表错误的问题。
一位研究人员报告称无法复现现代论文中的声明,在检查的7项声明中,有4项无法复现,2项在GitHub上存在未解决的问题,引发了对研究质量标准的担忧。