Claude 式科学:正确的计算,仍需一个值得问的问题
摘要
一篇评论文章,回应 Anthropic 发布的客座文章,后者介绍了 BootLoops——一系列工具,其中由 Claude 生成的计算在技术上是正确的,但只有在领域专家重新引导问题之后才获得了科学意义。文章主张,在把 AI 输出称为一项发现之前,算术验证与相关性/新颖性判断需要分别由专家独立审核;同时也指出,该客座文章的作者是 Anthropic 的访问研究员,而非独立基准测试者。
在 Anthropic 于 10 月 1 日发表的一篇客座文章中,Matthew Schwartz 描述了 BootLoops:一类用于定量工作的工具,能够跨科学领域连接不同技术。他报告称,许多初步结果在技术上是正确的,但只有在领域专家重新引导问题之后,才变得具有科学趣味。Schwartz 坦承自己是 Anthropic 的访问研究员;这是他的个人叙述,而非独立基准测试。这一区别对 AI 研究助理而言似乎十分重要。
“计算通过了验证”与“这个计算告诉了我们一些值得了解的东西”需要不同的审核。在把某个智能体的输出称为一项发现之前,我希望有专家说明:哪些内容此前已经知晓、这里提出了什么新的主张、以及什么样的观测结果能够将它与现有解释区分开来。可复现的代码有助于核查算术,但它本身无法判定相关性与新颖性。
你会如何组织这两类审核,以避免一份令人信服的报告把无关紧要的结果包装成头条新闻?
来源:https://www.anthropic.com/research/claude-shaped-science
AI 辅助讨论;我并未复现文中所述的项目。
相似文章
2026年10月1日 科学 Claude 式的科学
在这篇 Anthropic 的客座文章中,Matthew Schwartz 教授介绍了 BootLoops——这是一个由 Claude 构建的开源工具集,包含用于量化科学领域精确计算的科研软件与协议。通过有意瞄准那些“适合 Claude 处理”的问题,这些工具浮现出了与生态学、群体遗传学及其他领域的跨学科关联;随后,各领域专家协助将这些关联引导至真正具有科学意义的问题上。
Anthropic 刚刚发布了 Claude Science,基本上就是用于研究的 Claude Code
Anthropic 推出了 Claude Science,这是一款新的研究工具,类似于他们现有的用于编码的 Claude Code。
Claude 解决了一个重要的数学问题。
据报告,Claude 解决了一个重要的数学问题,引起了《科学美国人》(Scientific American)的关注。这一成就突显了 AI 驱动的数学推理领域的进展。
@AnthropicAI: 科学博客最新动态:是的,Claude 能进行九圈计算。理论物理学家使用公式预测粒子行为……
Claude AI 解决了理论物理中的九圈散射振幅问题,创下新纪录,并展示了人工智能在复杂科学计算中的潜力。
Claude 说
一篇批评在软件工作中不假思索地使用 Claude 等大语言模型的博文,认为由 AI 驱动的解决方案会导致系统过度工程化,遇事一味请示 AI 暴露出专业能力的欠缺,而以提示词为核心的开发方式则会侵蚀批判性思维。