如果 AI 代理无处不在,我们如何知道哪些值得信任?

Reddit r/AI_Agents 新闻

摘要

随着 AI 代理变得无处不在,挑战从比较性能转向建立信任和声誉,需要新的发现和验证系统。

目前很多关于 AI 的讨论似乎仍集中在性能上:哪个模型更聪明,哪个代理更快速,哪个工具推理能力更强等等。这些固然重要。但随着代理数量增多,我开始怀疑这些比较是否还那么有用。如果只有少数几个代理,你主要是比较性能。但如果有成千上万个代理,更棘手的问题可能是:你究竟该信任哪一个?这个代理以前做过类似工作吗?你能看到它的历史记录吗?其他用户信任它吗?输出结果是否经过了某种验证?哪些代理优先展示给用户,又是由谁决定的?这听起来更像是声誉/发现的问题,而非模型性能问题。未来的代理经济可能不仅需要更好的代理,还需要能够发现代理、比较它们、验证其历史记录,并在不完全依赖某个平台排名系统的情况下决定哪些值得使用。想听听大家的看法:代理的声誉应该由平台控制、用户评审、开放可移植、上链,还是其他方式?
查看原文

相似文章

AI 智能体开始干正事了。但收据在哪?

Reddit r/AI_Agents

文章指出了一个日益严重的问题:AI 智能体可以执行复杂任务,但其工作难以检查、信任和交接。作者提出了一种“工作凭证”系统,以提供透明、可分享的证明,展示智能体执行了哪些步骤、使用了哪些来源以及置信度,旨在帮助非技术用户自信地使用代理式 AI。