harness-optimization

标签

Cards List
#harness-optimization

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers · 3天前 缓存

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

0 人收藏 0 人点赞
#harness-optimization

@joelniklaus: 关于框架优化的新博客文章。我们以成本降低 7 倍达到了 Sonnet 4.6 的性能。Fable 5 是第一个……

X AI KOLs Following · 2026-07-01 缓存

一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。

0 人收藏 0 人点赞
#harness-optimization

Self-Harness: 自我改进的Harness

Hacker News Top · 2026-06-22 缓存

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。

0 人收藏 0 人点赞
#harness-optimization

回溯式工具链优化:通过轨迹回滚上的自我偏好改进LLM智能体

Hugging Face Daily Papers · 2026-06-04 缓存

回溯式工具链优化(RHO)是一种自监督方法,仅利用历史轨迹即可提升LLM智能体性能,在SWE-Bench Pro上实现78%的通过率,无需外部评分。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈