你的语言模型不需要更好的提示——它需要一个代理控制框架

Reddit r/AI_Agents 新闻

摘要

文章讨论了Agent控制框架工程(Agent Harness Engineering)的必要性,包括工具验证、上下文管理、护栏、遥测和验证循环等结构化系统,以使LLM代理在生产中可靠,并认为仅靠更好的提示是不够的。

构建了一个AI代理。以为困难的部分已经完成。演示?🔥 生产环境?💀 那个代理自信地声称它检查了从未打开的网页,跳过了验证,并幻觉了工具输出。那一刻我意识到:**语言模型不仅需要更好的提示——它们需要更好的系统。** 我一直在探索**Agent控制框架工程**——通过以下方式为代理添加结构:✅ 工具验证 🧠 上下文和状态管理 🛡️ 护栏 📊 遥测与追踪 🔁 验证循环 ⚖️ LLM作为法官的审计。简单的想法:**提示告诉模型该做什么。** **控制框架确保它真的做到了。**
查看原文

相似文章

你的LLM提示词有200行。你真的知道智能体遵从了多少吗?

Reddit r/AI_Agents

本文讨论了在生产环境中评估和监控基于LLM的智能体所面临的挑战,涵盖离线评估、提示工程陷阱、可观测性工具、审查队列、标注、聚类、主题分类,以及将人工审查、LLM作为评判和小型分类器进行成本分层的方法。

最好的智能代理工具会这样做……

Reddit r/AI_Agents

作者分享了构建高效智能代理工具的见解:最好的工具最大限度地减少对大语言模型(LLM)在琐碎任务上的依赖,将其保留用于复杂推理,从而将真正的代理工具与简单的包装器区分开来。

停止在不公开执行框架的情况下比较LLM智能体

arXiv cs.AI

这篇立场论文认为,在长期跨度的LLM智能体任务中,执行框架(即围绕语言模型的上下文构建、工具交互、编排和验证的基础设施层)往往比模型本身更能决定性能,而当前的基准测试错误地将框架层面的提升归因于模型改进。它提出了一种框架感知的评估框架,包含披露标准和方差分解协议。