我们构建了基于Harness的架构。

Reddit r/artificial 工具

摘要

Argus是一个通用的智能体运行时,适用于自主研究系统,通过持久记忆、验证和可插拔的部署架构,实现持续学习和自我进化。

本研究介绍了Argus,一个通用的智能体运行时,专为系统探索下一代自主研究系统而构建。Argus不仅仅是让智能体在单个任务中多次反思,而是针对一个关键问题:智能体能否通过利用持久记忆、外部验证和积累的经验,实现持续学习、适应和自我进化,以进行长期自主操作,而无需不断更新模型权重?在持久性、验证引导和自我进化机制的驱动下,Argus跨会话存储已验证的知识、技能、验证器、失败轨迹和决策洞察。它根据新证据自主决定持久化、回滚或转向,并在大部分时间里无人运行,同时在关键决策点保留人工在环反馈。Argus高度可插拔、可扩展和可部署,允许自由替换模型、工具、记忆模块和工作流。用户可以将领域特定的专业知识封装成垂直应用,并部署在云、本地或私有基础设施上。基于专家-智能体协同进化,专家设定目标和评估标准,而智能体进行探索、执行和验证,使专业人员和专门智能体能够协作推进研究。
查看原文

相似文章

Argus: A General-Purpose Agentic Runtime for Long-Horizon Reasoning

arXiv cs.AI

Argus is a persistent, self-evolving agentic runtime designed for long-horizon reasoning, using Manager, Planner, Engineer, and Reviewer roles with verification-gated persistence and pivoting. It demonstrates strong results across seven benchmark arenas, including ~78% on SWE-Bench Pro, while reducing token usage after runtime self-evolution.

Building an Advanced Agentic Harness

Hacker News Top

A technical blog post that walks through building a production-grade agentic harness around a basic LLM loop, covering typed tools, plan DAGs, tiered memory, verification hierarchies, budgets, and tracing.

面向长时应用开发的Harness设计

Anthropic Engineering

Anthropic工程师详细介绍了一种多智能体Harness设计,利用生成器与评估器智能体提升Claude在长时间内自主构建完整、高质量前端应用的能力。

HarnessX:可组合、自适应且可演进的智能体夹具工坊

Hugging Face Daily Papers

HarnessX 是一个为可组合、自适应且可演进的人工智能智能体夹具打造的工坊,它利用组合原语和轨迹驱动演化来提升智能体性能。在五项基准测试中,它平均提升了 +14.5%(最高达 +44.0%),表明运行时接口演化是模型规模扩展之外的一个互补杠杆。

@sethkarten: https://x.com/sethkarten/status/2072034978112889328

X AI KOLs Following

Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。