介绍 CoreWeave ARIA:AI研究与迭代代理(6分钟阅读)
摘要
CoreWeave ARIA 是一款集成到 Weights & Biases 中的 AI 驱动编码代理,它自动化了整个研究循环,从假设形成到实验执行和分析。
ARIA 会选择最高优先级的假设,设计实验,在你的基础设施上启动它,监控结果,并报告它学到的内容。
查看缓存全文
缓存时间: 2026/09/29 14:53
# 介绍 CoreWeave ARIA:AI 研究与迭代代理
来源:https://www.coreweave.com/blog/introducing-coreweave-aria-ai-research-and-iteration-agent
> **最初于 2026 年 7 月 29 日在 CoreWeave 的 Weights & Biases 博客上发布。**
**CoreWeave ARIA** 是直接集成在 Weights & Biases 中的编码代理,对该平台有着深入的了解。ARIA 会阅读你的实验,构建实时可视化图表来支持其分析,并且从你开始对话的那一刻起就完全掌握了你项目的上下文。这些能力共同驱动了一个完整的自主研究循环——从分析结果、形成假设,到启动下一个实验并评估返回的结果。
**ARIA 驱动着用于持续改进的自主研究循环**,它运行完整的研究周期,而不仅仅是分析它。描述你想了解的内容(例如“在注意力层之后添加 dropout 是否有助于缓解我观察到的过拟合问题?”),ARIA 会形成一个假设,编写配置,并通过 W&B Launch 在团队的计算资源上启动实验。
当运行完成后,ARIA 会将结果与你的基线进行评估,在工作区中添加对比面板,并起草一份 W&B 报告来描述其发现。如果结果不明确,它会建议一个后续步骤:一个不同的 dropout 比例、一个更长的调度周期、或在一组数值上进行扫描。每次运行都被跟踪,每个决策在对话中都可见,“运行完成”和“下一次运行配置完成”之间的间隔从数小时缩短到数分钟。
通过持续形成假设、运行实验、评估结果并执行最佳的下一步操作,ARIA 创建了一个自主研究循环,在你专注于需要人类判断的问题时,帮助模型和代理不断改进。
ARIA 分析了 674 次运行,识别出表现最佳的配置,并提出一个具体的后续实验方案,附带一个可直接使用的配置,你可以通过 W&B Launch 为其启动。
## 实时、持久化的仪表板以支持分析
当你向 ARIA 提问时,它不会回复一堆文字或一串数字。它会创建可共享的 W&B 工作区、面板和报告来支持其发现,速度比你自己配置要快得多。
**ARIA 知道哪种面板类型适合该问题:** 二维参数扫描使用热力图,探索超参数相互作用使用平行坐标图,比较离散配置使用柱状图。它筛选出最重要的运行,在需要聚合的地方进行分组,并构建一个在你对话结束后仍可继续使用的工作区视图。而且由于这些是实时 W&B 仪表板,它们会随着新运行的加入而更新,团队中的每个人都能看到,并且和你自己构建的任何东西一样具有可配置性。
**当 ARIA 建议后续步骤时**,支持的图表和面板让你一目了然地验证其推理。你无需阅读长篇大论,而是通过视觉化的证据来保持参与。
ARIA 识别出各次运行中的激活异常值,创建一个包含 5 个针对性折线图面板的置顶工作区部分,并设置运行过滤器以突出关键运行,所有操作都直接在用户的工作区中完成。
## 你的完整实验上下文已加载
当你从一个工作区页面打开 ARIA 时,它已经知道你的项目、你可见的运行和你的活跃过滤器。你无需截图你的工作区视图并粘贴到聊天窗口中,也无需解释你正在哪个项目中工作。
**这里的上下文不仅仅指你当前所在的页面:** ARIA 可以访问你记录到 W&B 的训练代码、实验日志、损失曲线、指标、制品和检查点。它还可以跨项目访问,并延伸到你队友的实验中。问问看“我的验证损失在第 12 个 epoch 趋于平稳,但下游评估分数仍在上升。这是怎么回事?”ARIA 就会调取训练日志,检查学习率调度,在你其他项目的类似运行中进行比较,并从 arXiv 上的近期论文中交叉参考相关技术。
对于跨多个项目工作、拥有成千上万条记录指标(从精确度数值到逐层梯度范数)的团队,ARIA 可以揭示那些难以手动发现的模式。
用户在一次失败运行的日志页面上问“发生了什么?”。ARIA 已经知道是哪次运行,看到了日志中的 CUDA OOM 错误,并开始调查。无需命名该运行或描述问题。
## 构建于对平台的深度理解之上
Weights & Biases 是一个 AI 开发者平台,旨在将研究项目扩展到数十万次实验和指标。通用编码代理可以通过 API 查询 W&B,但它并非为此而生。它不知道运行的显示名称和 ID 之间的区别,不知道如何优化查询运行历史 API,也不知道扫描中哪些可视化是自动生成的。在规模上它很吃力:当只有少数运行重要时却扫描整个项目,当摘要足够时却拉取完整的训练历史,进行冗余调用导致一个简单答案需要等待数分钟。
ARIA 由 W&B 团队基于平台的细微差别进行持续训练。它知道如何高效地限定查询范围、导航庞大的项目以及跨团队边界工作。结果就是?无论你的项目有 20 次还是 20,000 次运行,都能得到快速、可靠的答案。
当被问及是否有队友尝试过 sandwich norm 时,ARIA 知道要在所有 60 次运行的运行名称、配置、输出日志、代码制品和元数据中进行搜索,并准确报告它的搜索范围和排除的内容。
## 移动端可用
ARIA 已在 Weights & Biases 移动应用中可用。研究人员可以在移动中监控运行、调查结果并与 ARIA 交互。点击此处下载 (https://apps.apple.com/us/app/weights-biases/id6755162576)。
## 示例用例
以下是一些我们最受欢迎的用例:
- **分析:** 你能从我的结果中看到什么模式?
- **可视化:** 创建一个视图,突出关键运行和面板,包括一个关于异常值的部分。
- **调试:** 为什么我的一些运行出现了 OOM 错误?查看日志、代码和系统指标。
- **实验指导:** 下一组应该尝试的超参数是什么?为我启动这个作业。
- **搜索:** 我的队友在另一个项目中尝试相同的架构。找到他们最好的运行,然后导入到我的工作区进行比较。
- **产品问题:** 如何在同一图表上叠加多个指标?
## 未来发展方向
公开预览版只是一个开始。ARIA 的路线图引入了旨在改变团队开展机器学习研究方式的功能:
**为你整个团队服务的共享研究伙伴。** ARIA 的当前版本回答你的问题并构建你要求的东西。下一个版本将让整个团队都参与进来。想象一下共享的代理对话,每个人都能看到哪些问题已被提出、发现了哪些模式以及提议了哪些实验。一个共享看板,你的团队和 ARIA 都能贡献研究想法,ARIA 会跨项目和队友比较运行,揭示任何单个研究人员都可能忽略的关联。
ARIA 拾取优先级最高的假设,设计实验,通过 W&B Launch 在你的基础设施上启动,监控结果,并报告它的发现。随着时间的推移,ARIA 会构建一个关于你的项目、团队首选工作流和集体研究目标的持久记忆。
可扩展且为企业准备就绪。ARIA 适应你的团队工作方式。
- **编码自定义指令和技能**,使其遵循你的约定并运行首选的分析工作流。
- **通过自定义 MCP 服务器连接你自己的数据源**,使 ARIA 能够超越 W&B,访问你的内部工具、数据库或文档。
- **带来你自己的 API 密钥**以使用你偏好的 LLM 提供商。
- **在基础设施方面**,ARIA 将通过 MCP 连接到 CoreWeave Mission Control (https://www.coreweave.com/mission-control),让你能在同一个对话中分析计算和实验。
- **企业管理控制已在路线图中**,这样你的团队就可以在组织所需的治理下采用 ARIA。
## 开始使用
**ARIA 现已提供公开预览版。**
- 在 W&B 中打开任何项目,
- 点击侧边栏中的代理图标,
- 从你实验中的一个真实问题开始。
阅读文档 (https://docs.coreweave.com/products/aria) 开始使用。
相似文章
@CoreAutoAI:今天我们发布 Core Automation,目标是打造可优化并自动执行工作的系统,首先从研究流程开始。
CoreAutoAI 推出 Core Automation,一套旨在优化并自动执行工作、率先聚焦研究流程的系统。
AI研究智能体的递归自我改进
本文介绍了AIDE^2,这是一个系统,它使AI研究智能体能够通过递归自我改进自主提升其代码,从而在多种AI研究任务中获得性能提升。
Autoresearch:自我完善智能体背后的反馈循环(11分钟阅读)
Introspection是一家由前xAI工程师创立的新AI初创公司,它推出了'autoresearch'——一种反馈循环系统,智能体通过信号、评估和人类输入来维护并完善自身,超越了传统的智能体框架。
Weco AI 是一家研究实验室,其明确目标是:“构建递归自我改进的 AI。”CEO Jiang 发文称:“递归自我改进(RSI)的首个实验证据。”
Weco AI 宣布了使用其 AIDE 和 AIDE2 框架的递归自我改进(Level 1 RSI)的首个实验证据,其中 AI 自动改进内循环(模型训练)和外循环(搜索算法),以比人类调优系统快 100 倍的速度取得结果。
AutoResearch AI:迈向人工智能驱动的研究自动化以实现科学发现
本综述审视了人工智能驱动的研究自动化(AutoResearch)这一新兴领域,分析了AI系统如何从孤立的任务辅助转向完整的工作流级别的科学发现。它定义了从人类引导的‘Vibe Research’到AI主导系统的光谱,并提出了五个评估科学可信度的维度。