scientific-discovery

标签

Cards List
#scientific-discovery

迈向可审计的AI科学家:面向LLM代理的假设演化协议

arXiv cs.AI ↗ · 2026-07-13 缓存

本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。

0 人收藏 0 人点赞
#scientific-discovery

LLMs是否已准备好进行科学发现?面向AI科学家的能力导向基准

Hugging Face Daily Papers ↗ · 2026-07-13 缓存

介绍了SDABench,一个评估LLMs在五个领域六种科学分析能力上的基准,发现模型在需要假设选择和机制推理的任务上表现困难。

0 人收藏 0 人点赞
#scientific-discovery

AI推动研究职业发展,但削弱科学发现的多样性

Hacker News Top ↗ · 2026-07-12 缓存

一项对超过4000万篇论文的分析发现,AI工具提高了个人研究者的生产力和职业发展,但缩小了科学探究的范围,导致发现变得多样性和原创性降低,该研究发表在《自然》杂志上。

0 人收藏 0 人点赞
#scientific-discovery

@muratcan: 这里的提示工程超级令人印象深刻!这是代理提示的一个很好的例子:

X AI KOLs Timeline ↗ · 2026-07-10 缓存

Noam Brown 宣布,GPT-5.6 Sol Ultra 证明了一个50年历史的数学猜想,展示了令人印象深刻的提示工程和代理提示。

0 人收藏 0 人点赞
#scientific-discovery

游玩ZendoWorld:挑战AI智能体进行主动视觉概念归纳

arXiv cs.AI ↗ · 2026-07-10 缓存

介绍了ZendoWorld,这是一个受控的交互环境,用于评估AI智能体在主动视觉概念归纳方面的能力,智能体需要感知场景、推断隐藏的逻辑规则并设计信息丰富的实验。使用不同类别智能体的实验表明,高预测精度并不能保证规则恢复,基于VLM的智能体在信息性实验方面表现不佳,突出了与人类归纳推理之间的差距。

0 人收藏 0 人点赞
#scientific-discovery

Statistically Meaningful Geometry 与规范对称破缺:科学发现与智能涌现的几何基础

arXiv cs.LG ↗ · 2026-07-08 缓存

本文介绍了 Statistically Meaningful Geometry (SMG),这是一个几何框架,用于将过参数化学习系统建模为无限维非参数 Orlicz 纤维丛。它提出在分布外刺激下,系统会发生规范对称破缺,导致新的因果轴涌现,从而能够区分真正的科学发现与幻觉。

0 人收藏 0 人点赞
#scientific-discovery

FirstResearch: 面向LLM科学发现代理的可审计问题形成框架

arXiv cs.AI ↗ · 2026-07-08 缓存

FirstResearch 引入了一个结构化框架,用于LLM科学发现代理,该框架生成一份研究问题证书,包含原始定义、假设、机制、可证伪假设和失败更新规则,使得所提出的研究问题在执行前可被审查。使用LLM评估者的初步评估表明,以证书为中心的方法在可审计性和得分方面优于基线系统。

0 人收藏 0 人点赞
#scientific-discovery

重新思考智能体时代的科学发现

arXiv cs.CL ↗ · 2026-07-07 缓存

本文介绍了SCION,一个智能体科学操作系统,它通过研究执行计划(REP)和分层多智能体执行,集成了AI工具用于科学发现。该系统在材料分析、分子设计和蛋白质筛选等应用中表现出色,超越了现有的自主研究智能体基线。

0 人收藏 0 人点赞
#scientific-discovery

语言模型通过控制搜索引导符号方程发现

arXiv cs.AI ↗ · 2026-07-07 缓存

本文介绍了LLM-PySR,一种通过控制搜索参数让语言模型引导符号方程发现的方法,同时使用数值符号回归进行拟合。该方法在基准任务上实现了准确性与复杂性的良好平衡。

0 人收藏 0 人点赞
#scientific-discovery

达摩院推出能够发现超导体的AI智能体,或将革新科学材料研究与创新

Reddit r/singularity ↗ · 2026-07-04 缓存

达摩院(阿里巴巴)推出Elements Claw,这是一个通过筛选数百万晶体结构发现四种新型超导材料的AI智能体,有望加速材料研究。

0 人收藏 0 人点赞
#scientific-discovery

EO-Agents:面向地球观测假设生成的三智能体LLM流水线

arXiv cs.AI ↗ · 2026-07-03 缓存

EO-Agents 提出了一种三智能体LLM流水线,用于生成地球观测假设,利用NASA知识图谱和图神经网络对候选数据集配对进行排序,LLM智能体负责筛选、生成和评估结构化研究假设。

0 人收藏 0 人点赞
#scientific-discovery

@ai_suxiaole: 现在很多 AI 工具都能帮科研人员省时间 但大多数只解决一个环节: 读文献、写代码、润色论文、整理摘要。 Sakana AI 的 AI Scientist-v2 它想做的是一个能跑完整科研流程的 AI 系统 从生成研究假设开始,到设计实验…

X AI KOLs Timeline ↗ · 2026-07-02 缓存

Sakana AI 发布了 AI Scientist-v2,一个端到端的自动化科研系统,能够从生成研究假设到撰写论文自动完成,并已通过同行评审被 ICLR2025 Workshop 接收。

0 人收藏 0 人点赞
#scientific-discovery

基于证据的LLM信念用于持续科学发现

arXiv cs.AI ↗ · 2026-06-30 缓存

本文通过引入基于证据的非平稳信念,解决了基于LLM的科学发现中静态惊奇度的局限性,并提出了信念更新过滤和多样性最大化来改进发现,在五个领域实现了30.62%更高的非平稳惊奇度。

0 人收藏 0 人点赞
#scientific-discovery

当科学发现没有标准答案时,我们如何验证人工智能提出的假设

Reddit r/artificial ↗ · 2026-06-26

探讨了在科学发现中验证人工智能生成假设的挑战——当不存在基准真相时如何应对,并介绍了Apodex的多智能体方法,即使用独立的验证智能体作为解决方案。

0 人收藏 0 人点赞
#scientific-discovery

科学发现作为元优化:一个组合优化案例研究

arXiv cs.AI ↗ · 2026-06-26 缓存

本文提出将科学发现形式化为一个元优化问题,其中LLM通过相关性加权投票生成并聚合目标函数,应用于使用数字MemComputing的3-SAT算法发现,在大规模实例上实现了67倍的加速。

0 人收藏 0 人点赞
#scientific-discovery

加速回报与Qualitative Engine for Science

arXiv cs.AI ↗ · 2026-06-26 缓存

本文考察了Ray Kurzweil的加速回报理论,并指出,尽管定量能力可能加速,但真正的科学发现需要一种不同的能力:对概念框架进行定性推理。本文提出Qualitative Engine for Science(QES)作为对这一缺口的回应。

0 人收藏 0 人点赞
#scientific-discovery

物理超级智能

Reddit r/singularity ↗ · 2026-06-24 缓存

PSI正在建设一个垂直整合的物理超级智能工厂,旨在通过人工超级智能加速物理学突破,并开源了一款面向物理学家的AI助手“Get Physics Done(GPD)”。

0 人收藏 0 人点赞
#scientific-discovery

@OkhayIea: 每个人都在竞相构建“AI科学家”。因此我们提出了一个直白的问题:当今最好的编码代理能打败公开发表的…

X AI KOLs Timeline ↗ · 2026-06-24 缓存

介绍了NatureBench,这是一个跨学科基准测试,包含来自Nature论文的90个任务,用于测试AI编码代理。研究发现,最好的代理(Claude Opus 4.7)仅在17.8%的任务上超越了现有最佳水平,而且其成功往往是通过将科学简化为监督式机器学习,而非真正的发现来实现的。

0 人收藏 0 人点赞
#scientific-discovery

GPT-5如何帮助免疫学家Derya Unutmaz解开一个持续三年的谜团

OpenAI Blog ↗ · 2026-06-23 缓存

OpenAI的GPT-5 Pro帮助免疫学家Derya Unutmaz解开了一个关于葡萄糖如何影响T细胞分化的三年之谜,它提出脱氧葡萄糖会干扰IL-2蛋白的构建,从而导致促炎性Th17细胞增加。

0 人收藏 0 人点赞
#scientific-discovery

NatureBench:编码代理能否达到《自然》系列论文已发表的最优水平?

Hugging Face Daily Papers ↗ · 2026-06-23 缓存

NatureBench是一个跨学科基准测试,包含来自《自然》出版物的90个科学任务,旨在评估AI编码代理实现真正发现的能力。当前代理主要通过方法转化而非科学创新取得成功。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈