@joelniklaus: 关于框架优化的新博客文章。我们以成本降低 7 倍达到了 Sonnet 4.6 的性能。Fable 5 是第一个……
摘要
一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。
查看缓存全文
缓存时间: 2026/07/02 02:17
新博客文章:提示优化。我们以7倍成本改进达到了Sonnet 4.6的性能。
Fable 5 是首个在法律任务上进行评估的前沿模型版本,仅得分13%,在所有基准测试中表现最差。
@Harvey 在一个月前发布了名为 Legal Agent Benchmark(LAB)的基准测试。它包含一组逼真的法律事务。每个任务为智能体提供一个封闭的工作空间,内含文档(合同、电子邮件、电子表格、演示文稿),并要求生成具体的交付物:尽职调查报告、问题清单、修订稿、草稿。一个LLM裁判根据一份包含平均61项独立二元评分标准的详细评估表对交付物进行评级。
许多前沿模型,如Gemini 3.1 Pro,全部通过率(所有评分标准通过)未能超过0%。通过自动提示优化,我们成功将DeepSeek V4 Pro的全部通过率从0%提升至5%,以1/7的成本实现了与Sonnet 4.6同等的性能。
详情请阅读博客文章:https://huggingface.co/spaces/joelniklaus/harness-optimization…
不要训练模型,进化提示系统 - joelniklaus 的 Hugging Face 项目空间
来源:https://huggingface.co/spaces/joelniklaus/harness-optimization 正在从HF Docker仓库获取元数据……
相似文章
@sethkarten: https://x.com/sethkarten/status/2072034978112889328
Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。
@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396
自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。
@tonygentilcore: https://x.com/tonygentilcore/status/2075234683202531403
Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。
Self-Harness: 自我改进的Harness
Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。
Claude Code 在一夜之间将我的 Agent 框架性能提升了 40%
作者介绍了“Autoharness”,这是一个利用 Claude Code 通过迭代提示词和超参数来自主优化 Agent 框架的工具。在 tau2-airline 基准测试中,该工具使性能提升了 40%。