标签
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
介绍了SDABench,一个评估LLMs在五个领域六种科学分析能力上的基准,发现模型在需要假设选择和机制推理的任务上表现困难。
一项对超过4000万篇论文的分析发现,AI工具提高了个人研究者的生产力和职业发展,但缩小了科学探究的范围,导致发现变得多样性和原创性降低,该研究发表在《自然》杂志上。
Noam Brown 宣布,GPT-5.6 Sol Ultra 证明了一个50年历史的数学猜想,展示了令人印象深刻的提示工程和代理提示。
介绍了ZendoWorld,这是一个受控的交互环境,用于评估AI智能体在主动视觉概念归纳方面的能力,智能体需要感知场景、推断隐藏的逻辑规则并设计信息丰富的实验。使用不同类别智能体的实验表明,高预测精度并不能保证规则恢复,基于VLM的智能体在信息性实验方面表现不佳,突出了与人类归纳推理之间的差距。
本文介绍了 Statistically Meaningful Geometry (SMG),这是一个几何框架,用于将过参数化学习系统建模为无限维非参数 Orlicz 纤维丛。它提出在分布外刺激下,系统会发生规范对称破缺,导致新的因果轴涌现,从而能够区分真正的科学发现与幻觉。
FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。
本文介绍了SCION,一个智能体科学操作系统,它通过研究执行计划(REP)和分层多智能体执行,集成了AI工具用于科学发现。该系统在材料分析、分子设计和蛋白质筛选等应用中表现出色,超越了现有的自主研究智能体基线。
本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。
达摩院(阿里巴巴)推出Elements Claw,这是一个通过筛选数百万晶体结构发现四种新型超导材料的AI智能体,有望加速材料研究。
EO-Agents 提出了一种三智能体LLM流水线,用于生成地球观测假设,利用NASA知识图谱和图神经网络对候选数据集配对进行排序,LLM智能体负责筛选、生成和评估结构化研究假设。
Sakana AI 发布了 AI Scientist-v2,一个端到端的自动化科研系统,能够从生成研究假设到撰写论文自动完成,并已通过同行评审被 ICLR2025 Workshop 接收。
本文通过引入基于证据的非平稳信念,解决了基于LLM的科学发现中静态惊奇度的局限性,并提出了信念更新过滤和多样性最大化来改进发现,在五个领域实现了30.62%更高的非平稳惊奇度。
探讨了在科学发现中验证人工智能生成假设的挑战——当不存在基准真相时如何应对,并介绍了Apodex的多智能体方法,即使用独立的验证智能体作为解决方案。
本文提出将科学发现形式化为一个元优化问题,其中LLM通过相关性加权投票生成并聚合目标函数,应用于使用数字MemComputing的3-SAT算法发现,在大规模实例上实现了67倍的加速。
本文考察了Ray Kurzweil的加速回报理论,并指出,尽管定量能力可能加速,但真正的科学发现需要一种不同的能力:对概念框架进行定性推理。本文提出Qualitative Engine for Science(QES)作为对这一缺口的回应。
PSI正在建设一个垂直整合的物理超级智能工厂,旨在通过人工超级智能加速物理学突破,并开源了一款面向物理学家的AI助手“Get Physics Done(GPD)”。
介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。
OpenAI的GPT-5 Pro帮助免疫学家Derya Unutmaz解开了一个关于葡萄糖如何影响T细胞分化的三年之谜,它提出脱氧葡萄糖会干扰IL-2蛋白的构建,从而导致促炎性Th17细胞增加。
NatureBench是一个跨学科基准测试,包含来自《自然》出版物的90个科学任务,旨在评估AI编码代理实现真正发现的能力。当前代理主要通过方法转化而非科学创新取得成功。