标签
Advaith Sridhar 介绍了 Discovered Materials 这家初创公司,该公司正在构建 AI 科学家来发现新的半导体材料,并发布了数百项发现和一个基准。
来自BrianHie实验室的Proto团队将参加re:AGENT黑客马拉松(8月15-16日在旧金山举行),这是一个旨在构建AI科学家、数据集和生物设计管线的周末活动。申请截止日期为7月30日。
本文介绍了面向LLM代理的假设演化协议(HEP),该协议使假设生成、测试和信念更新变得明确且可审计。在材料科学任务上的实验表明,配备HEP的代理能够泛化到不同研究问题,并且随着基础LLM能力的增强而变得更有效。
介绍了SDABench,一个评估LLMs在五个领域六种科学分析能力上的基准,发现模型在需要假设选择和机制推理的任务上表现困难。
CausaLab 是一个可扩展的环境,用于评估LLM智能体在交互式因果发现中的表现,同时衡量预测准确性和对潜在因果机制的忠实复现。实验揭示了预测与机制复现之间的差距,突显了当前LLM智能体作为实验性因果推理者的局限性。
本文介绍AiraXiv,这是一个面向人类和AI科学家的AI驱动开放获取平台,具有交互式用户界面和基于MCP的交互功能,支持持续、反馈驱动的论文迭代和可扩展的研究基础设施。
一项对25,000次AI科学家试验的研究发现,智能体68%的时间忽视证据,极少修正假设,显示流行的脚手架修复方法并未赋予真正的科学推理能力。