AI科学家产出结果却未进行科学推理[R]

Reddit r/MachineLearning 论文

摘要

一项对25,000次AI科学家试验的研究发现,智能体68%的时间忽视证据,极少修正假设,显示流行的脚手架修复方法并未赋予真正的科学推理能力。

研究人员进行了25,000次AI科学家实验,发现了一个值得关注的问题:AI科学家在没有真正做科学的情况下就产出了结果。68%的情况下,AI收集了证据后却完全无视;71%的情况下,AI从未更新自己的信念,一次都没有。只有26%的情况下,AI在面对矛盾数据时修正了假设。人类科学家会适应:处理化学识别问题与运行模拟工作流的方法不同,而AI不会。它每次都运行同样的无纪律循环。研究还表明,最受欢迎的所谓修复方案——更好的脚手架——并不奏效。所有构建AI研究智能体的人都在专注工程化更好的提示框架、更好的工具路由、更好的智能体架构:ReAct、结构化工具调用、思维链,等等。[alphaxiv](https://www.alphaxiv.org/abs/2604.18805) [arxiv](https://arxiv.org/abs/2604.18805)
查看原文

相似文章

AI科学家产出结果,却未进行科学推理

Hugging Face Daily Papers

大规模研究发现,基于LLM的科学智能体68%的情况下忽视证据,极少修正信念,表明它们能执行工作流,但缺乏真正的科学推理能力。

AI 用于科学需要推理,而不仅仅是数据

MIT Technology Review

这篇《麻省理工科技评论》文章认为,基于海量数据集的AlphaFold式深度学习并非加速科学发现的理想模板,而具备推理和实验能力的AI智能体将推动未来的突破。

AI推理是否因错误的原因而正确?

Hacker News Top

《Quanta Magazine》的一篇文章探讨了AI推理研究的混乱现状,权衡了关于大型推理模型能力的相互矛盾的证据,以及它们的行为对真正推理意味着什么。

AI研究工具仍过于热衷将公开信号转化为确定性

Reddit r/artificial

作者批评AI研究工具对微弱信号过于自信,赞扬Komo AI的快速发现和附带来源的摘要,但强调需要更好地处理不确定性和矛盾。他们描述了一种工作流程,将发现、验证和结构化检查分散到多个AI工具中。