Prime Agent —— 超越 Codex/CC/PI 的新型编码框架
摘要
Prime Agent 是一个开源编码与研究框架,性能超越专有框架,在 ARC-AGI-3 上得分 95.5%,并在多个基准测试中提升模型表现。
Prime Agent 是一个开源的编码与研究代理,适用于通用和长期运行的任务。它是一个自我改进的 RLM 框架,用于编码和长期自主任务。通过程序化工具调用、将上下文视为变量、多代理消息传递以及可自我修改的框架状态,它被设计为既节省 token 又具有表现力。在 ARC-AGI-3 上,它得分 95.5%,超过了人类专家基线,但这种提升并非针对特定基准。与专有框架相比,我们看到各模型均有显著改进。Prime Agent 基于 pi 构建,完全开源,采用开放许可证。GitHub: https://github.com/PrimeIntellect-ai/prime-agent 博客: https://www.primeintellect.ai/blog/prime-agent X 帖子: https://x.com/primeintellect/status/2085086999267144083?s=46
相似文章
Prime Agent: 一个自我改进的RLM框架
Prime Agent 是一个开源框架,它使用递归子代理和持久化计算来扩展语言模型在编码和推理任务中的长期能力,显著提高了在ARC-AGI-3等基准测试上的性能。
Prime Agent
Prime Agent 是一个能够优化自身工具链的编程代理,已在 Product Hunt 上发布。
Prime Agent:一个自我改进的RLM智能体
Prime Intellect 推出 Prime Agent,这是一个完全开源、自我改进的编码工具(harness),围绕递归语言模型(RLM)和 Continual Harness 抽象构建,通过基于 REPL 的接口实现持久子智能体和动态工具。
PrimeIntellect-ai/prime-agent
Prime Agent 是 Prime Intellect 推出的开源编码与研究代理,结合了持久化 Python 环境、稳定的运行框架、子代理以及自我改进能力,适用于长时间运行的自主任务。
AA 推出 Coding Agent Index —— 模型与 Harness 组合的性能对比
Artificial Analysis 推出了 Coding Agent Index,这是一套新的基准测试套件,结合了 SWE-Bench-Pro-Hard-AA、Terminal-Bench v2 和 SWE-Atlas-QnA,旨在评估 AI 编程代理在多样化任务中的表现。