@Sumanth_077:别再手动测试和重写提示词了!大多数团队运行评估、查看失败、猜测问题、重写提示词……

X AI KOLs Timeline 工具

摘要

DeepEval引入了一种使用遗传算法对提示词进行进化优化的方法,允许基于评估反馈和多目标优化自动重写。

别再手动测试和重写提示词了!大多数团队运行评估、查看失败、猜测问题、重写提示词,然后重复。这很慢,而且你永远不知道你的重写是否真正解决了根本问题。更好的方法是进化优化。不再手动重写,而是使用遗传算法分析评估反馈并自动重写提示词。该算法维护多个擅长处理不同问题类型的候选提示词,而不仅仅是一个“最佳”版本。 DeepEval通过GEPA(基于帕累托选择的遗传进化)实现这一点。你提供提示词模板、测试用例和要优化的指标。优化器会处理其余部分。工作原理如下:它将你的测试用例分为验证集和反馈集。验证集公平地对每个提示词进行评分。反馈集为突变提供训练信号。然后开始进化:选择一个父代提示词,在小批量测试用例上运行,收集关于失败原因的指标反馈,并使用LLM重写提示词以解决这些问题。如果重写后的提示词得分更高,则将其添加到候选池中。经过多次迭代,返回得分最高的提示词。 关键能力: • 支持50多种内置指标——答案相关性、幻觉、偏见、任务完成度等。 • 支持多目标优化——同时优化多个指标,无需强制权衡。 • 可配置迭代次数和小批量大小——控制搜索全面性和计算成本。 最棒的是?100%开源。DeepEval链接见评论区!
查看原文
查看缓存全文

缓存时间: 2026/05/15 02:56

如果你觉得有用,请与你的网络分享

关注我 → @Sumanth_077,获取更多关于AI工程的见解和教程!

我来试试 @Sumanth_077

很高兴你觉得有帮助。

没错,突变不是随机的,而是针对特定指标失败的有针对性的修复。

相似文章

基于环境的LLM游戏智能体自动提示优化

arXiv cs.CL

介绍了一个针对LLM游戏智能体的自动提示优化框架,该框架将观察-行动流水线分解为两个智能体,并通过环境回报引导的进化循环迭代优化提示。在BabyAI任务上评估,显著提高了成功率(例如,在PutNext上从0%提升到72.5%),且无需更新模型权重。

SePO:用于系统提示优化的自进化提示智能体

arXiv cs.CL

SePO(自进化提示优化)提出了一种自指涉提示智能体,通过进化搜索同时优化任务智能体的系统提示和自身的系统提示。在包括 AIME'25、ARC-AGI-1 和 GPQA 在内的五个基准测试中,SePO 的表现优于 Manual-CoT、TextGrad 和 MetaSPO。