标签
This paper proposes MIDAS, a multi-LLM framework for data-adaptive summarization that automates prompt optimization for domain-specific enterprise use cases, achieving strong improvements over prior methods on customer ticket summarization benchmarks.
The author argues that RL environments serve as the essential data for building AI agents, enabling systematic training, prompt optimization, and evaluation rather than manual iteration.
FLARE是一个新框架,将少样本学习与反思机制相结合,以优化大语言模型的指令,在包括HotPotQA、工具调用和GoEmotions在内的多个基准测试中均优于GEPA。
DSPy 3.3.0 已发布,其特色是用于 GEPA 优化代码和提示词的 dspy.Flex,以及原生支持并行工具调用的 dspy.ReActV2,同时对首席维护者 Isaac Miller 表示赞赏。
本文介绍了自监督技能优化(SSO),这是一个利用LLM评判的成对比较,从未标注的任务实例中学习和优化可复用智能体技能的框架,无需真实标签或奖励。SSO在封闭式基准测试上优于现有的无真实标签提示优化器,并接近基于真实标签的方法。
本文介绍了ERGO,一种面向文本分类中迭代提示优化的错误驱动方法,该方法诊断分类失败并生成有针对性的决策规则,在错误集中于特定混淆标签对的任务上取得了最佳准确率。
本文介绍了类型感知修复分配(TARA),这是一个无需训练的框架,将文本到图像提示优化分解为原子修复分配,其中每个失败的命题被路由到类型条件的修复操作符。实验表明,TARA在DSG和TIFA基准测试上跨四个生成器取得了最佳语义准确性,在保持图像质量的同时优于VisualPrompter。
本文提出BayesPO,一种使用梯度引导离散MCMC与并行回火的贝叶斯提示优化框架,在指令归纳任务上提升了准确率。
本文介绍了MAGE,一个用于分析提示优化中组件交互的框架,揭示了一种提示优化耦合效应(POCE),其中结合多个随机信号可以提高性能但会增加方差。它提供了对稳定性-性能权衡的洞察以及提示优化的实用指导。
Pythia是一个多智能体系统,能够自主编写和优化用于临床概念的提取提示,无需手动提示工程或微调,使用本地托管的开放权重模型。在临床症状检测中,其平均敏感度为0.76,特异度为0.95,在特异度上优于基于词典的方法。
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。
推测性缓存预热在用户输入提示词时预先处理系统提示词和工具数组,从而在本地LLM推理中节省10-20秒的等待时间。该功能是用于本地AI的开源OpenFox框架的一部分,可在不破坏缓存一致性的前提下提升交互性。
本文分享了团队如何借鉴OpenAI的Harness工程理念,让AI Agent自主运行17小时、16轮迭代优化prompt,并成功上线的实践过程,包括防作弊、防止早停等关键机制。
本文提出了一种框架,用于自动优化基于LLM的对话推荐系统用户模拟器的提示,解决了正向偏差和行为多样性有限等问题。
Gnosys Labs 推出了一种自主模型工程方法,在标签稀缺的情况下改进分类器,在 ToxicChat 基准测试中优于 GEPA 等标准优化器。
提出了一种对比反思(Contrastive Reflection)迭代提示优化框架,用于智能体信息检索工作流。该框架利用结构化轨迹识别错误锚定的行为切片,并通过教师LLM进行对比修复,在HotpotQA上实现了显著改进。
Wayfinder Router 是一个开源的 Python 工具,它根据结构复杂性在本地或托管 LLM 之间确定性路由提示,无需调用任何模型,从而实现离线成本节省。
BinEval是一个新框架,它将LLM评估标准分解为原子化的二元问题,提高了可解释性,并实现了有针对性的提示优化,在事实一致性基准上取得了强劲的结果。
介绍了SPO,一种用于自动提示优化的随机搜索框架,包含三种策略,其中包括SAGE,一种智能体引导的多智能体流水线。在基准测试上进行了评估,并部署在心理健康聊天机器人上,通过持续优化显示出在留存率方面的改进。
微软推出SkillOpt,一种将智能体技能文档像神经网络一样训练的方法,通过epoch、batch、学习率和验证集来进行优化,但不修改模型权重。在多项基准测试中取得最佳结果,可跨模型和工具迁移。