优化器即智能体:跨提示、程序与机器学习工作流的推理驱动搜索

Hugging Face Daily Papers 论文

摘要

ReASearch 是一个统一框架,其中单个使用工具的智能体内化了用于优化提示、程序和机器学习工作流的搜索策略,在14项任务上优于专门的基线方法。

近期用于优化提示、程序和机器学习工作流的系统通常依赖显式的外循环控制器,例如进化搜索、多臂老虎机或文本梯度方法。我们提出了一个截然不同的问题:这种搜索策略在多大程度上可以被一个使用工具的智能体内化?我们提出了 ReASearch,一个用于推理驱动优化的统一框架,其中智能体自主决定评估什么、如何诊断失败、进行哪些修改,以及何时验证或重启。该智能体不仅仅是在手工设计的启发式规则引导下充当提案生成器,它还主动分析结果、分配预算,并通过持久记忆在长时程中细化其策略。凭借共享的智能体循环和领域专用工具,ReASearch 使用完全相同的脚手架来优化提示、程序和机器学习工作流。在 14 项不同任务中,它与专门的优化系统相比具有竞争力,并且大多数时候表现更好,相比强领域专用基线取得了 2% 至 40% 的提升,在某些情况下还发现了能改进先前人类已知最佳结果的解决方案。关键在于,我们观察到通常由显式控制器实现的复杂搜索行为,会自然地从智能体的推理过程中涌现出来。
查看原文
查看缓存全文

缓存时间: 2026/08/10 06:14

论文页面 - 优化器即智能体:跨提示、程序与ML工作流的推理驱动搜索

来源:https://huggingface.co/papers/2608.06714

摘要

近期用于优化提示、程序及ML工作流的系统通常依赖显式的外循环控制器,例如进化搜索、多臂老虎机或文本梯度方法。我们提出了一个根本不同的问题:这种搜索策略在多大程度上可以被单个使用工具的智能体内部化?我们提出ReASearch,一个用于推理驱动优化的统一框架,其中智能体自主决定评估什么、如何诊断失败、进行哪些编辑,以及何时验证或重新开始。智能体不仅充当由手工设计启发式引导的提议生成器,还主动分析结果、分配预算,并通过持久记忆在长时间跨度内精炼其策略。通过共享的智能体循环和领域特定工具,ReASearch使用完全相同的脚手架来优化提示、程序和ML工作流。在14个多样化任务中,它与专门的优化系统相比具有竞争力,且多数情况下表现更好,相较于强领域特定基线取得了2%至40%的提升,在某些情况下还发现了优于先前人类已知最佳结果的解决方案。关键在于,我们观察到通常由显式控制器实现的复杂搜索行为,会从智能体的推理过程中自然涌现。

查看arXiv页面(https://arxiv.org/abs/2608.06714)查看PDF(https://arxiv.org/pdf/2608.06714)添加到收藏夹(https://huggingface.co/login?next=%2Fpapers%2F2608.06714)

在您的智能体中获取此论文:

hf papers read 2608\.06714

没有最新的CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

无模型关联此论文

在模型README.md中引用arxiv.org/abs/2608.06714以将其链接到此页面。

引用此论文的数据集0

无数据集关联此论文

在数据集README.md中引用arxiv.org/abs/2608.06714以将其链接到此页面。

引用此论文的Space0

无Space关联此论文

在Space README.md中引用arxiv.org/abs/2608.06714以将其链接到此页面。

包含此论文的收藏集0

无收藏集包含此论文

将这篇论文添加到收藏集(https://huggingface.co/new-collection)以将其链接到此页面。

相似文章

SAGE:基于智能体引导的随机提示优化

arXiv cs.CL

介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。