@joelniklaus: 关于框架优化的新博客文章。我们以成本降低 7 倍达到了 Sonnet 4.6 的性能。Fable 5 是第一个……

X AI KOLs Following 新闻

摘要

一篇博客文章描述了自动框架优化如何使 DeepSeek V4 Pro 在法律代理基准测试上以七分之一的成本达到 Sonnet 4.6 的性能。

关于框架优化的新博客文章。我们以成本降低 7 倍达到了 Sonnet 4.6 的性能。 Fable 5 是第一个在法律任务上评估的前沿模型版本。它仅得分 13%,在所有评估的基准测试中表现最差。 @Harvey 一个月前发布了这个名为 Legal Agent Benchmark (LAB) 的基准测试。它包含一组现实的法律事务。每个任务为代理提供一个封闭的文档工作空间(合同、电子邮件、电子表格、幻灯片),并要求交付具体成果:尽职调查备忘录、问题清单、修订版、草案。LLM 裁判根据一个冗长的评分标准对交付成果进行评分,该评分标准平均包含 61 个不同的二元标准。 许多前沿模型(如 Gemini 3.1 Pro)的全通过率(所有评分标准都通过)未能超过 0%。通过自动框架优化,我们成功将 DeepSeek V4 Pro 的全通过率从 0% 提升到 5%,以七分之一的价格达到了与 Sonnet 4.6 相当的性能。 阅读博客文章了解详情:https://huggingface.co/spaces/joelniklaus/harness-optimization…
查看原文
查看缓存全文

缓存时间: 2026/07/02 02:17

新博客文章:提示优化。我们以7倍成本改进达到了Sonnet 4.6的性能。

Fable 5 是首个在法律任务上进行评估的前沿模型版本,仅得分13%,在所有基准测试中表现最差。

@Harvey 在一个月前发布了名为 Legal Agent Benchmark(LAB)的基准测试。它包含一组逼真的法律事务。每个任务为智能体提供一个封闭的工作空间,内含文档(合同、电子邮件、电子表格、演示文稿),并要求生成具体的交付物:尽职调查报告、问题清单、修订稿、草稿。一个LLM裁判根据一份包含平均61项独立二元评分标准的详细评估表对交付物进行评级。

许多前沿模型,如Gemini 3.1 Pro,全部通过率(所有评分标准通过)未能超过0%。通过自动提示优化,我们成功将DeepSeek V4 Pro的全部通过率从0%提升至5%,以1/7的成本实现了与Sonnet 4.6同等的性能。

详情请阅读博客文章:https://huggingface.co/spaces/joelniklaus/harness-optimization…


不要训练模型,进化提示系统 - joelniklaus 的 Hugging Face 项目空间

来源:https://huggingface.co/spaces/joelniklaus/harness-optimization 正在从HF Docker仓库获取元数据……

相似文章

@sethkarten: https://x.com/sethkarten/status/2072034978112889328

X AI KOLs Following

Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。

@AlphaSignalAI: https://x.com/AlphaSignalAI/status/2074130508833845396

X AI KOLs Timeline

自我改进的机制使AI代理能够通过分析执行轨迹自主重写其运行规则,从而实现60%的性能提升。来自上海AI实验室的研究引入了Self-Harness框架,使得轻量级模型能够在无需人工工程的情况下超越更大规模的模型。

@tonygentilcore: https://x.com/tonygentilcore/status/2075234683202531403

X AI KOLs Timeline

Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。

Self-Harness: 自我改进的Harness

Hacker News Top

Self-Harness 提出了一种新范式,其中基于LLM的智能体通过挖掘模型特定的弱点、提出框架修改,并通过回归测试验证这些修改,从而迭代地改进自身的运行框架,在Terminal-Bench-2.0上跨多个基础模型取得了显著的性能提升。