agent-harness

标签

Cards List
#agent-harness

Mara Chain:将失败重新构想为 AI 系统自动演进的垫脚石

arXiv cs.LG ↗ · 10小时前 缓存

论文提出了 Mara Chain,一种精炼方法,它将被拒绝的 AI 系统配置(提示词、技能、运行框架、代码)转化为可复用的垫脚石,而非直接丢弃。该方法在 AppWorld 上实现了最高 20.5% 的性能提升,并在 TerminalBench 2.1 和 MuSiQue 上取得大幅进步,同时仅需远少于以往的 rollout 次数。

0 人收藏 0 人点赞
#agent-harness

介绍 KoboldCpp Agent(以及求助信息)

Reddit r/LocalLLaMA ↗ · 4天前

介绍了 KoboldCpp Agent,这是一个内置的智能工具框架,用于轻松创建代码和执行通用任务,支持 MCP 工具和第三方后端,同时提醒用户注意针对用户的虚假钓鱼网站。

0 人收藏 0 人点赞
#agent-harness

@ericzakariasson: 这里有一个基于我们在Cursor学到的经验来改进你的代理框架的提示。享受 # 改进这个代理框架…

X AI KOLs Timeline ↗ · 6天前 缓存

本文分享了一个基于Cursor经验教训的提示和实用指南,用于提高LLM代理框架的令牌效率,旨在降低成本而不牺牲任务质量。

0 人收藏 0 人点赞
#agent-harness

Strands Harness

Hacker News Top ↗ · 6天前 缓存

介绍Strands harness,这是一款新的开源代理框架,提供前沿性能,令牌成本比Claude Code等其他框架低28%,支持多种AI模型并易于部署。

0 人收藏 0 人点赞
#agent-harness

@LangChain: 今天 PT 11am / ET 2pm。加入我们 + @typesafeai 与 Jev 一起进行关于构建代理工具的直播会议!RSVP: https:…

X AI KOLs Following ↗ · 2026-09-22

LangChain 和 Typesafe AI 今天 PT 11am / ET 2pm 举办一场与 Jev 一起构建代理工具的直播会议。

0 人收藏 0 人点赞
#agent-harness

@seekjourney:一个值得密切关注的强劲新RSI信号:Google Research 已开始研究递归自我改进……

X AI KOLs Timeline ↗ · 2026-09-22 缓存

Google Research 已开始为 Agent Harness 研究递归自我改进,重点是无需模型重新训练即可自动迭代提示、工具、内存和控制流。这种 Harness 级别的方法被认为比模型级别的 RSI 更清晰、更实用。

0 人收藏 0 人点赞
#agent-harness

我比较了6个“代理框架”项目,并记录了每个项目何时优于其他项目

Reddit r/AI_Agents ↗ · 2026-09-22

作者比较了六个代理框架项目,以诚实、非炒作的方式评估它们的优势和理想用例。

0 人收藏 0 人点赞
#agent-harness

@jinchenma_ai: Jev 真的有那么强吗?你真的了解 Jev 吗?最近,整个网络都在热议 Jev,而我……

X AI KOLs Timeline ↗ · 2026-09-21 缓存

本文批判性地审视了 Jev,一个针对快速、结构化输出和成本效率进行优化的AI模型,同时质疑其判断与大型模型相比的可靠性。

0 人收藏 0 人点赞
#agent-harness

@omarsar0:一直在将Jev集成到我的自定义工具中。我对看到的结果感到无比兴奋。大多数演示……

X AI KOLs Timeline ↗ · 2026-09-19 缓存

Omar Saroof分享了将Jev集成到自定义工具中的兴奋之情,强调了它实现更快、更便宜、更可靠的AI工作流和代理体验的潜力。

0 人收藏 0 人点赞
#agent-harness

@aigclink: NVIDIA的开源代理工具专注于令牌效率:SoL-Pi,比原生工具减少35–64%的令牌,50…

X AI KOLs Timeline ↗ · 2026-09-19 缓存

NVIDIA的SoL-Pi是一个开源代理工具,通过自动化检查和重构AI工作流程以提高效率,减少35-64%的令牌使用和50-54%的API成本。

0 人收藏 0 人点赞
#agent-harness

@omarsar0:大家,构建你自己的框架。这是来自NVIDIA关于自进化代理框架的绝佳论文。(收藏它…)

X AI KOLs Timeline ↗ · 2026-09-18 缓存

论文介绍了SoL-Pi,一种自动化框架发现方法,可将token使用量减少近一半,并将API成本削减约三分之一,同时在基准测试中保持性能,使用诸如GPT-5.6 Sol和Opus 5的模型。

0 人收藏 0 人点赞
#agent-harness

@akshay_pachaar: https://x.com/akshay_pachaar/status/2100888166219886818

X AI KOLs Timeline ↗ · 2026-09-18 缓存

本文介绍了统一 Harness 协议(UHP)和 HarnessRouter,它们能在 Codex 和 Claude Code 等不同运行时中标准化代理执行,从而让产品避免依赖单一的 Harness 环境。

0 人收藏 0 人点赞
#agent-harness

@omarsar0: 如果你正在构建自定义代理框架,使用 MCP 工具。前沿 LLMs 对 MCP 非常熟悉。测试和集成…

X AI KOLs Timeline ↗ · 2026-09-17 缓存

该推文建议使用 MCP 工具构建自定义代理框架,因为前沿 LLMs 对 MCP 非常熟悉,使得测试和集成更容易,这基于作者的积极经验。

0 人收藏 0 人点赞
#agent-harness

SoL-Pi:递归扩展自动研究循环以实现高效代理框架

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

SoL-Pi 引入了一种在编码代理中递归扩展自动研究循环的方法,在保持基准测试性能的同时,显著减少令牌消耗和成本。

0 人收藏 0 人点赞
#agent-harness

LabAgent:使用AI代理为科学发现定制任意研究枢纽

arXiv cs.AI ↗ · 2026-09-15 缓存

LabAgent是一个AI代理系统,旨在为科学发现定制研究枢纽,实现跨各种生物领域的可重复和连续实验室工作,并超越商业通用代理。

0 人收藏 0 人点赞
#agent-harness

@stretchcloud: 本地推理正成为一个产品类别,而不仅仅是一个基准测试表。Perplexity 在 Wi… 上推出了 Portable Computer。

X AI KOLs Timeline ↗ · 2026-09-14 缓存

Perplexity 在 Windows RTX 电脑上推出了 Portable Computer,使得本地 AI 推理能够通过设备上的代理工具实现,将竞争格局中的焦点从推理成本转向工具质量。

0 人收藏 0 人点赞
#agent-harness

当编码代理比我们更快时,Git diff 还是适合人类审查的正确工具吗?

Reddit r/AI_Agents ↗ · 2026-09-14

作者质疑随着编码代理加速,Git diff 是否仍然足以供人类审查,并建议转向审查代理的后果和决策,通过增强的工具链以实现更好的监督。

0 人收藏 0 人点赞
#agent-harness

围绕GPT-3.5 Turbo构建代理框架所教会我的:每一个修复都是代码,而非提示

Reddit r/AI_Agents ↗ · 2026-09-14

作者分享了为GPT-3.5 Turbo构建代理框架的见解,强调基于代码的验证和防护措施对于可靠的AI代理性能至关重要。

0 人收藏 0 人点赞
#agent-harness

框架还是模型?通过受污染控制的私有测试套件隔离代理编程中的框架效应

arXiv cs.CL ↗ · 2026-09-14 缓存

该研究使用受污染控制的私有基准测试,隔离了代理编程系统中框架与模型的影响,发现供应商原生框架并无一致优势,且在成本和任务性能上存在差异。

0 人收藏 0 人点赞
#agent-harness

HarnessVLN:通过代理线束统一无训练实体导航

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

HarnessVLN是一个零样本、无需训练的实体导航框架,通过统一工具接口整合了感知、检索、定位、导航、恢复和终止功能,在R2R和RxR等基准测试中达到了最先进的结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈