介绍 CoreWeave ARIA:AI研究与迭代代理(6分钟阅读)

TLDR AI 产品

摘要

CoreWeave ARIA 是一款集成到 Weights & Biases 中的 AI 驱动编码代理,它自动化了整个研究循环,从假设形成到实验执行和分析。

ARIA 会选择最高优先级的假设,设计实验,在你的基础设施上启动它,监控结果,并报告它学到的内容。
查看原文
查看缓存全文

缓存时间: 2026/09/29 14:53

# 介绍 CoreWeave ARIA:AI 研究与迭代代理 来源:https://www.coreweave.com/blog/introducing-coreweave-aria-ai-research-and-iteration-agent > **最初于 2026 年 7 月 29 日在 CoreWeave 的 Weights & Biases 博客上发布。** **CoreWeave ARIA** 是直接集成在 Weights & Biases 中的编码代理,对该平台有着深入的了解。ARIA 会阅读你的实验,构建实时可视化图表来支持其分析,并且从你开始对话的那一刻起就完全掌握了你项目的上下文。这些能力共同驱动了一个完整的自主研究循环——从分析结果、形成假设,到启动下一个实验并评估返回的结果。 **ARIA 驱动着用于持续改进的自主研究循环**,它运行完整的研究周期,而不仅仅是分析它。描述你想了解的内容(例如“在注意力层之后添加 dropout 是否有助于缓解我观察到的过拟合问题?”),ARIA 会形成一个假设,编写配置,并通过 W&B Launch 在团队的计算资源上启动实验。 当运行完成后,ARIA 会将结果与你的基线进行评估,在工作区中添加对比面板,并起草一份 W&B 报告来描述其发现。如果结果不明确,它会建议一个后续步骤:一个不同的 dropout 比例、一个更长的调度周期、或在一组数值上进行扫描。每次运行都被跟踪,每个决策在对话中都可见,“运行完成”和“下一次运行配置完成”之间的间隔从数小时缩短到数分钟。 通过持续形成假设、运行实验、评估结果并执行最佳的下一步操作,ARIA 创建了一个自主研究循环,在你专注于需要人类判断的问题时,帮助模型和代理不断改进。 ARIA 分析了 674 次运行,识别出表现最佳的配置,并提出一个具体的后续实验方案,附带一个可直接使用的配置,你可以通过 W&B Launch 为其启动。 ## 实时、持久化的仪表板以支持分析 当你向 ARIA 提问时,它不会回复一堆文字或一串数字。它会创建可共享的 W&B 工作区、面板和报告来支持其发现,速度比你自己配置要快得多。 **ARIA 知道哪种面板类型适合该问题:** 二维参数扫描使用热力图,探索超参数相互作用使用平行坐标图,比较离散配置使用柱状图。它筛选出最重要的运行,在需要聚合的地方进行分组,并构建一个在你对话结束后仍可继续使用的工作区视图。而且由于这些是实时 W&B 仪表板,它们会随着新运行的加入而更新,团队中的每个人都能看到,并且和你自己构建的任何东西一样具有可配置性。 **当 ARIA 建议后续步骤时**,支持的图表和面板让你一目了然地验证其推理。你无需阅读长篇大论,而是通过视觉化的证据来保持参与。 ARIA 识别出各次运行中的激活异常值,创建一个包含 5 个针对性折线图面板的置顶工作区部分,并设置运行过滤器以突出关键运行,所有操作都直接在用户的工作区中完成。 ## 你的完整实验上下文已加载 当你从一个工作区页面打开 ARIA 时,它已经知道你的项目、你可见的运行和你的活跃过滤器。你无需截图你的工作区视图并粘贴到聊天窗口中,也无需解释你正在哪个项目中工作。 **这里的上下文不仅仅指你当前所在的页面:** ARIA 可以访问你记录到 W&B 的训练代码、实验日志、损失曲线、指标、制品和检查点。它还可以跨项目访问,并延伸到你队友的实验中。问问看“我的验证损失在第 12 个 epoch 趋于平稳,但下游评估分数仍在上升。这是怎么回事?”ARIA 就会调取训练日志,检查学习率调度,在你其他项目的类似运行中进行比较,并从 arXiv 上的近期论文中交叉参考相关技术。 对于跨多个项目工作、拥有成千上万条记录指标(从精确度数值到逐层梯度范数)的团队,ARIA 可以揭示那些难以手动发现的模式。 用户在一次失败运行的日志页面上问“发生了什么?”。ARIA 已经知道是哪次运行,看到了日志中的 CUDA OOM 错误,并开始调查。无需命名该运行或描述问题。 ## 构建于对平台的深度理解之上 Weights & Biases 是一个 AI 开发者平台,旨在将研究项目扩展到数十万次实验和指标。通用编码代理可以通过 API 查询 W&B,但它并非为此而生。它不知道运行的显示名称和 ID 之间的区别,不知道如何优化查询运行历史 API,也不知道扫描中哪些可视化是自动生成的。在规模上它很吃力:当只有少数运行重要时却扫描整个项目,当摘要足够时却拉取完整的训练历史,进行冗余调用导致一个简单答案需要等待数分钟。 ARIA 由 W&B 团队基于平台的细微差别进行持续训练。它知道如何高效地限定查询范围、导航庞大的项目以及跨团队边界工作。结果就是?无论你的项目有 20 次还是 20,000 次运行,都能得到快速、可靠的答案。 当被问及是否有队友尝试过 sandwich norm 时,ARIA 知道要在所有 60 次运行的运行名称、配置、输出日志、代码制品和元数据中进行搜索,并准确报告它的搜索范围和排除的内容。 ## 移动端可用 ARIA 已在 Weights & Biases 移动应用中可用。研究人员可以在移动中监控运行、调查结果并与 ARIA 交互。点击此处下载 (https://apps.apple.com/us/app/weights-biases/id6755162576)。 ## 示例用例 以下是一些我们最受欢迎的用例: - **分析:** 你能从我的结果中看到什么模式? - **可视化:** 创建一个视图,突出关键运行和面板,包括一个关于异常值的部分。 - **调试:** 为什么我的一些运行出现了 OOM 错误?查看日志、代码和系统指标。 - **实验指导:** 下一组应该尝试的超参数是什么?为我启动这个作业。 - **搜索:** 我的队友在另一个项目中尝试相同的架构。找到他们最好的运行,然后导入到我的工作区进行比较。 - **产品问题:** 如何在同一图表上叠加多个指标? ## 未来发展方向 公开预览版只是一个开始。ARIA 的路线图引入了旨在改变团队开展机器学习研究方式的功能: **为你整个团队服务的共享研究伙伴。** ARIA 的当前版本回答你的问题并构建你要求的东西。下一个版本将让整个团队都参与进来。想象一下共享的代理对话,每个人都能看到哪些问题已被提出、发现了哪些模式以及提议了哪些实验。一个共享看板,你的团队和 ARIA 都能贡献研究想法,ARIA 会跨项目和队友比较运行,揭示任何单个研究人员都可能忽略的关联。 ARIA 拾取优先级最高的假设,设计实验,通过 W&B Launch 在你的基础设施上启动,监控结果,并报告它的发现。随着时间的推移,ARIA 会构建一个关于你的项目、团队首选工作流和集体研究目标的持久记忆。 可扩展且为企业准备就绪。ARIA 适应你的团队工作方式。 - **编码自定义指令和技能**,使其遵循你的约定并运行首选的分析工作流。 - **通过自定义 MCP 服务器连接你自己的数据源**,使 ARIA 能够超越 W&B,访问你的内部工具、数据库或文档。 - **带来你自己的 API 密钥**以使用你偏好的 LLM 提供商。 - **在基础设施方面**,ARIA 将通过 MCP 连接到 CoreWeave Mission Control (https://www.coreweave.com/mission-control),让你能在同一个对话中分析计算和实验。 - **企业管理控制已在路线图中**,这样你的团队就可以在组织所需的治理下采用 ARIA。 ## 开始使用 **ARIA 现已提供公开预览版。** - 在 W&B 中打开任何项目, - 点击侧边栏中的代理图标, - 从你实验中的一个真实问题开始。 阅读文档 (https://docs.coreweave.com/products/aria) 开始使用。

相似文章

AI研究智能体的递归自我改进

Hugging Face Daily Papers

本文介绍了AIDE^2,这是一个系统,它使AI研究智能体能够通过递归自我改进自主提升其代码,从而在多种AI研究任务中获得性能提升。

AutoResearch AI:迈向人工智能驱动的研究自动化以实现科学发现

arXiv cs.AI

本综述审视了人工智能驱动的研究自动化(AutoResearch)这一新兴领域,分析了AI系统如何从孤立的任务辅助转向完整的工作流级别的科学发现。它定义了从人类引导的‘Vibe Research’到AI主导系统的光谱,并提出了五个评估科学可信度的维度。