你的语言模型不需要更好的提示——它需要一个代理控制框架
摘要
文章讨论了Agent控制框架工程(Agent Harness Engineering)的必要性,包括工具验证、上下文管理、护栏、遥测和验证循环等结构化系统,以使LLM代理在生产中可靠,并认为仅靠更好的提示是不够的。
构建了一个AI代理。以为困难的部分已经完成。演示?🔥 生产环境?💀 那个代理自信地声称它检查了从未打开的网页,跳过了验证,并幻觉了工具输出。那一刻我意识到:**语言模型不仅需要更好的提示——它们需要更好的系统。** 我一直在探索**Agent控制框架工程**——通过以下方式为代理添加结构:✅ 工具验证 🧠 上下文和状态管理 🛡️ 护栏 📊 遥测与追踪 🔁 验证循环 ⚖️ LLM作为法官的审计。简单的想法:**提示告诉模型该做什么。** **控制框架确保它真的做到了。**
相似文章
你的LLM提示词有200行。你真的知道智能体遵从了多少吗?
本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。
研究如何构建LLM智能体框架
这篇研究文章回顾了关于构建LLM智能体框架的研究成果,强调确定性护栏、有效的多智能体层次结构和适当的记忆架构对性能和安全至关重要,同时指出了当前评估和认证中的空白。
从提示到契约:面向可审计企业级LLM代理的约束工程
介绍了一种约束工程方法,用于构建可审计的企业级LLM代理,通过将确定性行为转移到代码、模式和验证工件中,并在韩国企业数据上通过故障注入和模型替换测试进行了演示。
大多数大语言模型评估工具是否仍然过于侧重提示词?
作者质疑当前的 LLM 评估工具是否过于关注孤立的提示词,而忽视了完整的工作流程和智能体交互,并指出逐步的准确性可能会掩盖生产环境中整体行为的偏差。
HarnessDev:LLMs能否创建并演化其自身的代理执行框架?
HarnessDev通过评估LLMs构建和演化执行框架的能力,揭示了模型间性能的显著差异以及较差的迁移性。