自然是我们学习环境 (17分钟阅读)
摘要
Periodic Labs 利用其实验室数据训练了 Periodic Neon 模型,在科学研究的 XRD 分析中超越了像 GPT-6 Astra 和 Claude Fable 5.1 这样的前沿模型,以更低的成本实现了成功率提升20倍。
Periodic Neon 在高度挑战性的科学分析评估中,以更低的成本超越了 GPT-6 Astra 和 Claude Fable 5.1。Neon 现已部署在实验室中,用于分析实验以改进超导体和磁体。该模型通过在实验室数据上的中期训练和强化学习,建立了帕累托最优的成本-性能前沿。Periodic Neon 在 FrontierXRD 上以更低的每次分析成本超越了前沿模型。
查看缓存全文
缓存时间: 2026/09/16 14:25
# 自然是我们的学习环境——周期实验室
来源:https://periodic.com/news/nature-is-our-learning-environment
利用自身实验室的数据,我们训练出周期Neon模型,在极具挑战性的科学分析评估中,以更低成本超越了GPT-6 Astra和Claude Fable 5.1。目前Neon已部署于我们的实验室,正分析各类实验以探寻更优的超导体与磁性材料。
X射线衍射(XRD)分析是我们研究工作的关键能力。科学家们常需耗费数小时穿梭于科学软件、相关实验、文献与数据库间,以解析复杂的XRD测量结果。周期Neon在我们最严苛的内部评估集FrontierXRD上达到了**55.3%的成功率**,较我们微调的开源模型Kimi K2.6初始的**2.7%**成功率实现了**20倍提升**。通过中期训练与强化学习在我们实验室数据上的应用,Neon建立了帕累托最优的成本效益前沿。
周期Neon XRD分析性能与成本对比
*周期Neon在FrontierXRD评估中以更低的单次分析成本超越前沿模型。我们报告了来自实验室的134个样本测试结果,这些样本因其复杂性与模糊性,人类专家需耗费数小时才能解析。所有模型均采用周期框架运行,该框架在我们应用场景中的表现优于Claude Code或Codex等通用编程框架。此处成功率由Opus 5与GPT-5.6-Sol组成的LLM评判团评估,并经专家评级校准。对外部模型我们基于标准API价格估算成本(假设代理轮次间完美缓存),对我方模型则按H200每小时系统吞吐量及$2.5/小时的H200单价计算成本。*
> ### **什么是XRD?** 合成实验可能始于目标材料及精心选择的前驱体与条件,但产物可能包含目标相、未反应前驱体及意外副产物的混合物。在决定下一步实验前,科学家需确定形成物种类及其比例。粉末X射线衍射(XRD)是解决此问题的主要工具之一。我们将X射线照射粉末并测量其散射模式。由于晶体中原子呈重复排列,每个结晶相都会产生特征峰图谱——即其原子结构的“指纹”。峰位反映晶格间距与晶体对称性,峰强则取决于原子种类、位置及各相含量。在多相粉末中,图谱相互重叠,即使专家也难以识别物相并估算比例。理解实验是否成功合成目标相至关重要,但随着自动化实验室规模扩大,科学家已无法手动跟进分析XRD结果。成功的XRD分析需要综合考量合成条件、既往实验、热力学计算及晶体结构数据库。实现这类长上下文代理工作的自动化,能解放科学家数小时的时间,使其能监控更多实验。
*我们实验室的X射线衍射仪。Neon从这类仪器产生的XRD数据中学习。可展开阅读框了解更多XRD背景知识。*
> ### **XRD评估的难点** 现有XRD软件功能强大,但需科学家先缩小排查范围才能发挥最佳效果:例如确定可能存在哪些元素、哪些物相合理、哪些拟合符合化学逻辑。在材料发现的合成领域,这往往是难点所在。样品可能包含多重物相,正确答案取决于前驱体、温度、气氛、环境、处理历史、相关样本、文献、能量计算及模拟等综合背景。科学家虽使用自动化工具,但仍需以专业判断引导:发现异常时扩大搜索、排除化学不合理的物相、当拟合数学表现良好但科学逻辑不成立时修正假设。例如:若样品曾在空气中加热,氧化物可能合理;只有在可能接触水分时,氢氧化物才可能合理。对于复杂样品,这种整体解读可能耗费专家数小时处理每个图谱。我们的评估聚焦于这些更困难的多相案例——在已有公认解的图谱中,平均包含五种物相。
周期Neon的XRD分析推理示例
*周期Neon的XRD分析交互演示,展示模型在根据XRD图谱推断样品物相时,对不同假说进行推理的逻辑要点。*
这些成果更加坚定了我们的信念:扩大自动化实验室及其学习AI系统的规模,将使我们能攻克当前无法企及的科学问题。我们最终的训练使用了1,300块H200 GPU,远低于Astra据报道使用的10万+Blackwell GPU。将训练算力提升至当今前沿模型水平,将释放更强大的科学能力。
科学分析性能随强化学习算力提升而增强
*周期Neon的科学分析性能随实验数据强化学习算力的扩展而提升,更高的推理算力带来进一步增益。Kimi K3展示了未来Neon训练可能采用的更强开源基座。这些观察结果共同推动我们同步扩展自动化实验室与AI学习系统的规模。*
为评估Neon在FrontierXRD之外的泛化能力,我们还测试了其对实验室化学体系中未参与中期训练和强化学习的XRD测量数据的分析表现。Neon在此评估中超越前沿模型,表明它掌握了可迁移的XRD分析能力,能超越训练阶段接触的化学体系范畴。
向未见化学体系的泛化表现
*我们使用198个实验性XRD测量数据测试Neon的泛化能力,这些数据来自实验室中未参与强化学习与中期训练的化学体系(系统内的小部分子系统可能出现在训练中)。该基准测试检验了对未见化学体系的泛化能力,但比专注于人类专家也难以解析的样本的FrontierXRD任务更简单。*
除利用实验数据扩展训练算力外,Neon还受益于多项基础设施与研究改进,以下重点介绍部分成果:
- **科学框架**:科学能力不仅取决于模型智能,还依赖模型可调用的资源,如科学数据库与工具。针对基于Claude Code与标准XRD工具构建的框架,周期的科学框架以相似的单次分析成本实现了3.8倍更高的XRD分析成功率。所有模型对比(包括上文的帕累托图)均采用周期科学框架进行。
> ### **周期框架*对比*Claude Code与标准XRD工具** 我们构建了配备实验室上下文、*内部*材料结构与模拟数据库、科学XRD分析软件的框架。对比中为Claude Code接入开源数据库(COD (https://www.crystallography.net/cod/)、Materials Project (https://next-gen.materialsproject.org/))与分析软件(BGMN (https://www.profex-xrd.org/)),代表不具备我们内部基础设施的典型科学家工具集。因此两套框架都具备完成任务的适配工具。使用相同基础模型(Claude Opus 5高推理强度模式)时,我们的框架在FrontierXRD上的表现优于Claude Code + 开源数据库软件组合。周期科学框架与Claude Code对比
- **超越可验证奖励的强化学习**:科学具有*可证伪性*但不易验证:在我们的设定中,XRD分析成功无法仅通过图谱拟合廉价验证,而需要专家科学判断来确定每个物相是否被图谱支持且符合化学逻辑。为从实验室数据中学习,我们将专家判断转化为重推理的LLM评判者,使其达到科学家彼此间*相当*的一致性水平。
> ### **LLM评判者与人类科学家的一致性** 为评估XRD分析质量,我们制定了详细评分标准,由拥有材料相关学科博士学位的专家团队为数千张XRD图谱提供质量标注。每张图谱由三位专家独立标注。随后使用两个代理型LLM评判者组成的集成为同样图谱提供质量标签,对比人类专家间一致性及人类专家与LLM评判者集之间的一致性。结果显示人类专家间一致性为77.2%,LLM评判者集与人类专家一致性为74.6%。当LLM评判者与专家共识比较时,一致性达84%。此一致性表明LLM评判者可为无标准标签且图谱拟合不足的任务提供训练与评估信号。LLM评判者与专家科学家的一致性
- **科学中期训练**:我们在学术文献、代码与实验数据的多模态混合语料上进行周期Neon的中期训练,以构建广泛的科学认知。我方专有中期训练语料库正快速扩展,目前月增长率达100%。观察发现通过中期训练注入科学知识能提升后续强化学习性能。
> ### **中期训练提升强化学习扩展性** 尽管中期训练数据中仅小部分聚焦XRD,早期消融实验显示中期训练后的Neon在后续强化学习中获得更高奖励,在FrontierXRD上成功率更高。科学中期训练提升强化学习性能
科学分析的累积研究成果
*从拥有1万亿参数的开源模型起步,我们通过在实验数据训练上的持续突破,不断强化其科学分析能力。每个点代表独立的强化学习训练运行,标注大致标出主要改进方向。所有结果均使用周期框架与高推理算力设置报告。*
回顾历程,我们的进展源于实验数据算力扩展与多项研究基础设施突破(如长上下文多模态强化学习)的结合——上图展示了这些突破带来的累积增益。目前我们正利用AI系统进行实验设计、执行与学习,将其应用于实验室更广泛的科学工作流。欢迎参阅我们关于支撑此研究的AI基础设施的博文(https://periodic.com/news/ai-infrastructure-at-periodic)。
相似文章
@MTSlive: 检测到情况:Periodic Labs使用了1,300个H200,加上数月自己的实验数据,来训练和强化学习一个开放权重模型…
Periodic Labs训练了一个开放权重AI模型,使用1,300个NVIDIA H200 GPU和内部实验室数据,在其内部基准测试中超越了GPT-6 Astra。
@JeffDean: 激动人心的结果,@LiamFedus!祝贺Periodic Labs的整个团队!
Jeff Dean祝贺Periodic Labs在构建高通量材料实验室方面取得激动人心的成果,该实验室利用H200 GPU将实验与AI模型相结合,为数据驱动发现创造了反馈循环。
模型不再是瓶颈(6分钟阅读)
Anthropic 的通用AI模型 Claude(未经化学微调)在核磁共振分析中表现优于 ChemDraw 和 MestReNova 等专业软件,这表明科学AI领域的瓶颈已从模型能力转向工作流设计。
@tszzl: Neon 是一项非常酷的工作,它相当于为超级智能提供一个与现实世界交互的接口,以便创造和研究……
Neon 项目利用 AI 和高通量实验室,在实验与模型之间建立循环,旨在加速材料研发。
@_jasonwei:非常酷的结果,展示了湿实验室数据如何让一个专用模型在……科学前沿的某项任务上超越 GPT-6 Astra
该文章强调了湿实验室数据如何使专用模型在科学任务上超越 GPT-6 Astra,凸显了领域特定数据对于推动人工智能在科学前沿发展日益增长的重要性。