展示HN:Raven – 多重工具架构,专为递归自我优化设计

Hacker News Top 工具

摘要

Raven 是一个开源工具,用于协调多个AI代理执行复杂任务,并具备递归自我改进的能力。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/29 13:58

单界面,全代理:Raven 生成 DAG 并编排多个专业代理处理复杂任务。

Raven 在多智能体编排基准测试中的表现

游戏演示视频

网站 ↗

海报

演示文稿 · PPTX ↓

CFD 破坝仿真

FEA 极限载荷搜索

网站 ↗

海报

演示文稿 · PPTX ↓

物理小游戏 · 在线游玩 ↗

README

海报

演示文稿 · PPTX ↓

Raven-Research 在 DeepResearch 混合基准测试中的表现

Raven-Code 在编程基准测试中的表现

Raven-Code 在 DataAgentBench 数据分析任务中位列第一 (2026-08-24 实时)

Raven-Design 在 PresentBench 幻灯片生成任务中位列第一

Raven-Design 在视觉设计基准测试中的表现

Raven-Oncall 在 AI4AI 任务的质量和成本方面显著优于 Claude Code

Raven-Oncall 在 AI4S 任务的成功率和成本方面显著优于 Claude Code

新任务:一位作曲家,只需一键即可调用技能、剧本、知识与记忆。

子代理:所有已连接代理一览,包括内置代理与第三方代理。

相似文章

Raven:可组合代理智能的元框架

Hugging Face Daily Papers

Raven 推出一个开源的多代理生态系统,该系统自动构建和进化用于AI代理的模块化工具,增强可组合智能,并在复杂、跨域任务上性能超越最先进的系统。

递归式 Harness 自我改进

arXiv cs.AI

介绍了递归式 Harness 自我改进(RHI),这是一种通过成对反馈迭代优化 AI 智能体提示级别 Harness 规范的方法,能够在多种机器学习研究任务上将性能提升高达 60%,并将推理成本降低高达 60%。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。

Harness Arena - 开源代理工具盲测基准

Reddit r/AI_Agents

Harness Arena 是一个开源的盲测基准工具,旨在比较各种AI代理工具在受控、匿名条件下的表现,以提供公平评估并邀请社区贡献。