相似的提示在每次运行时可能会生成不同的智能体计划,而我依然没有很好的测试方案

Reddit r/AI_Agents 工具

摘要

作者讨论了测试基于LLM的智能体管道时的挑战,其中相似的提示可能导致输出变化,提倡使用基于属性的检查而非精确匹配来处理非确定性输出。

在Hospilot中,一个目标通过LLM被转化为一系列智能体的管道——不是从固定列表中选择,而是根据目标文本实际决定使用哪些智能体以及它们的顺序。说实话,这就是关键所在,这正是它对于未预先定义的任务有用的原因。烦人的是,运行两次相似的提示,你可能会得到不同的图。这不一定错误,通常各自都没问题,只是不同。当有人类监督并随意选择时还好,但当你试图编写一个测试说“给定这个目标,管道应该像X”时,情况就糟糕多了,而X在每次运行中并不稳定。像正常测试那样假设确定性——相同输入永远相同输出,直到你修改代码。这个假设在这里完全不成立。代码没变,提示几乎没变,输出仍然不保证匹配。我们所做的不是断言精确的图,而是断言它的属性——它是否包含了此类目标必须有的智能体,是否遵守了传入的任何约束,是否避免了超出范围的内容。这比精确匹配弱,但至少测试的是真实的东西,而不是“模型今天是否和上周二一样感觉”。有人找到了比基于属性的检查更好的方法吗?测试LLM决策中允许变化但不允许错误的部分,感觉像是一个独立的学科,而我读过的大多数测试建议完全不适用于此。
查看原文

相似文章

你的LLM提示词有200行。你真的知道智能体遵从了多少吗?

Reddit r/AI_Agents

本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。

Agent 运行越久,我就越不在意提示词

Reddit r/AI_Agents

作者反思了长期运行的人工智能代理如何遭遇与初始提示无关的失败,并认为环境设计(工具、文档、验证、架构规则)更为重要。他们讨论了诸如 harness 工程、保持 AGENTS.md 文件精简、使用 linter 和评估器代理等概念,同时指出了成本权衡。