@Sumanth_077:别再手动测试和重写提示词了!大多数团队运行评估、查看失败、猜测问题、重写提示词……
摘要
DeepEval引入了一种使用遗传算法对提示词进行进化优化的方法,允许基于评估反馈和多目标优化自动重写。
别再手动测试和重写提示词了!大多数团队运行评估、查看失败、猜测问题、重写提示词,然后重复。这很慢,而且你永远不知道你的重写是否真正解决了根本问题。更好的方法是进化优化。不再手动重写,而是使用遗传算法分析评估反馈并自动重写提示词。该算法维护多个擅长处理不同问题类型的候选提示词,而不仅仅是一个“最佳”版本。
DeepEval通过GEPA(基于帕累托选择的遗传进化)实现这一点。你提供提示词模板、测试用例和要优化的指标。优化器会处理其余部分。工作原理如下:它将你的测试用例分为验证集和反馈集。验证集公平地对每个提示词进行评分。反馈集为突变提供训练信号。然后开始进化:选择一个父代提示词,在小批量测试用例上运行,收集关于失败原因的指标反馈,并使用LLM重写提示词以解决这些问题。如果重写后的提示词得分更高,则将其添加到候选池中。经过多次迭代,返回得分最高的提示词。
关键能力:
• 支持50多种内置指标——答案相关性、幻觉、偏见、任务完成度等。
• 支持多目标优化——同时优化多个指标,无需强制权衡。
• 可配置迭代次数和小批量大小——控制搜索全面性和计算成本。
最棒的是?100%开源。DeepEval链接见评论区!
查看缓存全文
缓存时间: 2026/05/15 02:56
如果你觉得有用,请与你的网络分享
关注我 → @Sumanth_077,获取更多关于AI工程的见解和教程!
我来试试 @Sumanth_077
很高兴你觉得有帮助。
没错,突变不是随机的,而是针对特定指标失败的有针对性的修复。
相似文章
@leanxbt: https://x.com/leanxbt/status/2070852461494202609
一篇详细介绍Loop Prompt Engineering的文章,这是一种通过基于数据集评估迭代重写提示来自动化提示优化的方法,重点强调避免递归陷阱。
我们构建了一个用于智能体提示词的自动化QA/评估引擎。来帮我们测试一下吧!
构建了一个名为Baseline的自动化QA/评估引擎,将提示词视为软件进行回归测试,允许非编程人员定义评分标准并自动优化提示词。目前处于有限公测阶段,提供30天免费试用。
基于环境的LLM游戏智能体自动提示优化
介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。
SePO:用于系统提示优化的自进化提示智能体
SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。
RECAP:面向提示持续适应性的回归评估基准
介绍了RECAP,一个用于在主动适应场景下评估提示持续学习能力的基准。结果表明,现有提示优化方法在该场景下表现不佳,亟需新方法。