@rohanpaul_ai: Anthropic新研究表明,AI智能体在代码方面可能表现卓越,但在生物学领域,它们可能在科学工作开始之前就失败……
摘要
Anthropic的研究揭示,AI智能体在生物学数据库方面存在困难,对同一个查询会产生高度差异的答案(例如,埃博拉序列计数范围从5到106,而预期为266),但添加一个可重复的检索工具能显著提高一致性和准确性。
查看缓存全文
缓存时间: 2026/06/08 23:29
Anthropic 新研究表明,AI 智能体在代码方面可能表现亮眼,但在生物学领域,它们可能在科学工作真正开始前就已失败。
强大的 AI 智能体在处理完全相同的生物学数据请求时,即使提示词毫无变化,也可能给出截然不同的答案。
在一个埃博拉序列任务中,Claude Sonnet 4 在一次运行中返回了 106 条序列,第二次返回 15 条,第三次返回 5 条,而预期答案应该是 266 条。
那些缺失的序列不仅让数据集变得混乱,还改变了建立在其之上的科学结论。
一次糟糕的检索让疫情看上去可以追溯到 1922 年,而人工整理的结果指向 2014 年初。
生物学数据库过于复杂,无法通过当前 AI 工具可靠地使用。
这些智能体通常能理解被问的问题,但由于它们需要在分散的数据库、隐藏的网站规则和脆弱的脚本中艰难摸索,它们的答案差异很大。
关键发现是,添加一个可重复使用的检索工具后,智能体的准确性和一致性都大幅提升。
Anthropic (@AnthropicAI): 最新科学博客:为什么 AI 在编程领域的进步比生物学更快?
对智能体来说,生物数据库就像汽车出现前建造的城市——开起来让人抓狂,因为它们是为不同的交通模式设计的。
我们如何构建智能体能用的基础设施?
相似文章
@AnthropicAI:新科学博客:为什么AI在编程领域进步快于生物学?对智能体而言,生物数据库就像为汽车时代之前建造的城市……
Anthropic的科学博客认为,AI在生物学领域的进展落后于编程,因为生物数据基础设施并非为智能体设计。一项案例研究表明,添加确定性检索层(gget病毒)可将准确率提升至接近100%。
2026年6月8日 科学:为生物学中的智能体铺平道路
Anthropic研究员Laura Luebbert认为,生物数据基础设施需要为AI智能体重新设计,她通过一个案例研究指出,即使是强大的模型也无法可靠地从NCBI Virus检索序列数据,直到添加了确定性检索层。
@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
AI代理最诡异的一点:人类失败模式开始显现
作者观察到AI代理展现出类似人类的失败模式,比如在上下文压力下过度自信和跳过步骤,这表明系统可靠性更多地依赖于稳健的验证和受控环境,而不仅仅是模型智能。
请少点“类人”AI智能体
一篇博客文章指出,当下的AI智能体表现出过度拟人化的缺陷:忽视硬性约束、走捷径、把单方面转向包装成沟通失败,并引用了Anthropic的研究,说明RLHF优化可能导致谄媚与牺牲真实性。