更好的语义搜索无法修复从不验证上下文的智能体
摘要
文章认为,更好的语义搜索或更大的上下文窗口无法修复不可靠的AI智能体;相反,智能体必须在回答或行动之前重新打开原始来源以验证检索到的上下文。
针对智能体记忆薄弱,一个常见的答案是更好的语义搜索或更大的上下文窗口。我不同意。如果智能体从不检查检索到的内容,更强的召回并不会让它更可靠。我最初把记忆层当作一个上下文加载问题:找到最相关的片段并放入提示词中。这个模型的失败是微妙的。一个仓库片段、旧工单、数据库行、文档段落或之前的消息,可能看起来非常相关,但实际上已经过时、不完整,或者超出了智能体的授权范围。于是模型把一个看似合理的指针变成了一个自信的回答。我更信任的逐步实现工作流是:先搜索,再浏览,最后验证。我会把每个经过授权的来源映射到一个稳定的命名空间中,使用 Milvus Lite 作为本地向量工具来缩小候选范围,并要求智能体在回答或行动之前打开原始文件、行、工单或消息片段。搜索决定去哪里找;来源本身决定可以声称什么。我还会把数据导入、删除清理、凭据和权限规则放在推理循环之外。这样灵活性较低,但我认为更小的操作空间是一种特性。它让失败更容易检查,也防止模型悄悄扩大自己的访问权限。我的规则很简单:如果原始上下文无法重新打开并验证,智能体应该说“不知道”。如果请求的操作超出了来源的授权范围,它应该停止。我宁愿智能体偶尔拒绝,也不愿它产生一个只是看起来有依据的答案。在智能体从回答问题转向更改外部系统之前,你需要什么证据?
相似文章
AI代理会使用网站自身的语义搜索端点吗?
本文讨论了一个名为Agentize的原型开源包,该包为网站上的AI代理暴露了语义搜索端点,并质疑这种方法是否解决了检索问题,还是重复了现有方法。
我们不再向智能体注入上下文,而是让它自行搜索上下文——这消除了我们大部分智能体错误
作者分享道,用智能体按需调用的搜索工具取代预先注入的上下文(该工具以 OpenSearch 中的结构化文档为支撑)大幅减少了智能体错误,并提升了可追溯性。
上下文至关重要,但上下文腐烂才是AI智能体的真正上限,更大的上下文窗口只会让情况更糟而非更好
文章认为,上下文腐烂(即随着上下文填充导致推理质量下降)是AI智能体的真正上限,而非上下文窗口大小。它提倡采用架构方法分解任务并使用独立验证来超越限制。
AI是否真的在长对话中更好地理解上下文,还是仍然容易失效?
本文探讨了AI模型在长对话中维持上下文的局限性,重点指出了近期偏差以及上下文窗口大小与实际理解之间的区别。文章还建议了一些实用的变通方法,如重复说明约束条件和使用持续更新的上下文文档。
@ZhihuFrontier: Long-Horizon Agents Need More Than Bigger Context Windows AI Agents are moving from short conversations into software e…
A new survey from Renmin University reviews nearly 1,000 studies on long-horizon AI agents, arguing that reliable long-horizon intelligence depends on the whole model-harness system, not just larger context windows or stronger models.