标签
这篇 arXiv 论文研究了语言模型在着手化解矛盾之前,如何判断两项科学发现是否具有可比性。在一个受控任务中,不可满足的 XOR 约束被翻译成实验报告;当约束条件显式给出时,GPT-5.6 Sol 和 Claude Opo 5 都能很好地还原出最有力支持的赋值方案,但当研究发现以科学散文的形式呈现时,模型往往倾向于遵从生物学上的既有预期。
一场关于 Modal 的 Runtime 活动的演讲预告,活动将在旧金山举行,来自 NVIDIA、Typesafe AI、Runway 和 Achira AI 的工程师将分享有关 AI x Science、推理、训练和智能体方面的内容。
一个AI系统自主构建了逐原子模拟器并进行了数日实验,发现了在相同质量下强度提升约25%的石墨烯设计。
ScienceBuddy 是 PhAI Labs 开发的一款免费、专注于生物医学的 AI 工具,帮助研究人员进行科学分析,如差异表达分析,并通过纠正用户输入和避免数据伪造来强调准确性。
Lila Sciences 正在开发一个集成的 AI 驱动平台,以自动化科学实验,使用 AI 模型和机器人技术来解决科学中不可验证的假设,愿景是创建科学智能的缩放定律。
本文评估了人工智能在27个科学领域中与传统统计学和科学计算的性能对比,发现人工智能通常在更高计算成本下优于统计学,但在更低计算成本下日益优于科学计算,从而重塑了科学前沿。
ARCHE是一个自主代理系统,集成了推理和计算模型,以自动化发现和验证化学反应机理,并通过多种化学场景进行了验证。
本文讨论了像 AlphaGenome 这样的 AI 模型如何通过在生物学中缩小搜索空间来推动科学突破,强调了 AI 在高效指导研究方面的作用。
Anima Anandkumar 博士被《时代》杂志评为人工智能领域 100 位最具影响力的人物之一,并创立了她的公司 Accelerated Understanding,以整合人工智能和科学。
安妮玛·安南德库马尔教授被《时代》杂志评选为人工智能领域100位最具影响力人物之一,与此同时,她专注于融合人工智能与科学的公司 Accelerated Understanding 公开推出。
本文探讨了当前AI模型是否能够通过加速假设生成和研究,推动突破性的科学发现,如新材料的发现,并与LK-99超导体事件进行类比。
介绍了IG-Bench,一个用于科学谱系推理和创意生成的基准测试,将科学作品表示为Idea Genome对象。评估了14个基于LLM的科学家,发现了一个组合瓶颈,最强系统在谱系推理上的精确准确率仅为27.3%。
Anthropic推出了Claude Science,这是一款用于科学研究的旗舰产品,能够自主执行计算生物学和药物开发中的任务,标志着该公司在人工智能应用于科学领域下了一个大赌注。
本文提出了一种概念与方法论框架,用于评估AI辅助研究中的证据许可声明,强调校准作为管理科学断言权利的机制,并区分不同的AI研究路径。
Anthropic推出了Claude Science,这是一款用于计算生物学和药物开发自主科学研究的新旗舰产品,所有付费Claude订阅用户均可使用。
探讨了在科学发现中验证人工智能生成假设的挑战——当不存在基准真相时如何应对,并介绍了Apodex的多智能体方法,即使用独立的验证智能体作为解决方案。
这篇立场论文认为,对AI的科学理解必须超越事后分析,转而研究塑造模型行为的训练动态,这对于预测、干预和设计训练过程以获取期望特性(如能力和安全性)具有重要意义。
《麻省理工科技评论》的新闻简报报道了三则重要故事:Anthropic的Code with Claude活动显示开发者越来越多地未经审核就直接部署AI编写的代码;即将举行的Enhanced Games允许运动员使用兴奋剂;以及Google I/O转向以代理型AI驱动科学,推出了Gemini for Science。
文章讨论了当前AI系统如何协助科学工作流程的部分环节,可能在数据丰富的领域加速渐进式发现,但仍受限于对现有文献和人类定义目标的依赖,存在认知同质化的风险。
Google I/O主题演讲强调了AI驱动科学的转变,将WeatherNext等专用工具与能够自主进行研究的智能体AI系统进行对比,标志着资源和热情的重新调整。