标签
论文提出了 Mara Chain,一种精炼方法,它将被拒绝的 AI 系统配置(提示词、技能、运行框架、代码)转化为可复用的垫脚石,而非直接丢弃。该方法在 AppWorld 上实现了最高 20.5% 的性能提升,并在 TerminalBench 2.1 和 MuSiQue 上取得大幅进步,同时仅需远少于以往的 rollout 次数。
介绍了 KoboldCpp Agent,这是一个内置的智能工具框架,用于轻松创建代码和执行通用任务,支持 MCP 工具和第三方后端,同时提醒用户注意针对用户的虚假钓鱼网站。
本文分享了一个基于Cursor经验教训的提示和实用指南,用于提高LLM代理框架的令牌效率,旨在降低成本而不牺牲任务质量。
介绍Strands harness,这是一款新的开源代理框架,提供前沿性能,令牌成本比Claude Code等其他框架低28%,支持多种AI模型并易于部署。
LangChain 和 Typesafe AI 今天 PT 11am / ET 2pm 举办一场与 Jev 一起构建代理工具的直播会议。
Google Research 已开始为 Agent Harness 研究递归自我改进,重点是无需模型重新训练即可自动迭代提示、工具、内存和控制流。这种 Harness 级别的方法被认为比模型级别的 RSI 更清晰、更实用。
本文批判性地审视了 Jev,一个针对快速、结构化输出和成本效率进行优化的AI模型,同时质疑其判断与大型模型相比的可靠性。
Omar Saroof分享了将Jev集成到自定义工具中的兴奋之情,强调了它实现更快、更便宜、更可靠的AI工作流和代理体验的潜力。
NVIDIA的SoL-Pi是一个开源代理工具,通过自动化检查和重构AI工作流程以提高效率,减少35-64%的令牌使用和50-54%的API成本。
论文介绍了SoL-Pi,一种自动化框架发现方法,可将token使用量减少近一半,并将API成本削减约三分之一,同时在基准测试中保持性能,使用诸如GPT-5.6 Sol和Opus 5的模型。
本文介绍了统一 Harness 协议(UHP)和 HarnessRouter,它们能在 Codex 和 Claude Code 等不同运行时中标准化代理执行,从而让产品避免依赖单一的 Harness 环境。
该推文建议使用 MCP 工具构建自定义代理框架,因为前沿 LLMs 对 MCP 非常熟悉,使得测试和集成更容易,这基于作者的积极经验。
SoL-Pi 引入了一种在编码代理中递归扩展自动研究循环的方法,在保持基准测试性能的同时,显著减少令牌消耗和成本。
LabAgent是一个AI代理系统,旨在为科学发现定制研究枢纽,实现跨各种生物领域的可重复和连续实验室工作,并超越商业通用代理。
Perplexity 在 Windows RTX 电脑上推出了 Portable Computer,使得本地 AI 推理能够通过设备上的代理工具实现,将竞争格局中的焦点从推理成本转向工具质量。
作者质疑随着编码代理加速,Git diff 是否仍然足以供人类审查,并建议转向审查代理的后果和决策,通过增强的工具链以实现更好的监督。
作者分享了为GPT-3.5 Turbo构建代理框架的见解,强调基于代码的验证和防护措施对于可靠的AI代理性能至关重要。
该研究使用受污染控制的私有基准测试,隔离了代理编程系统中框架与模型的影响,发现供应商原生框架并无一致优势,且在成本和任务性能上存在差异。
HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。