在你的智能体和不可逆的工具调用之间,究竟有什么?

Reddit r/AI_Agents 新闻

摘要

这篇推文讨论了AI智能体中不可逆工具调用缺乏安全机制的问题,并介绍了OrcaRouter的新代理防火墙功能,该功能在执行前对工具/MCP调用进行评分,同时强调了独立评估的必要性。

我一直注意到的是,人们把安全机制放在哪里。要么放在模型内部,这不可靠且无法真正审计;要么根本没有,你只能从日志中发现。几乎没有人有东西能读取实际的工具或MCP调用并决定是否允许其运行。我认为这部分值得从智能体代码中独立出来。如果你已经让每个智能体通过一个端点来访问任何模型,那么同一个端点就是在调用触发前进行评分的明显位置。OrcaRouter的网关正是添加了这个功能,一个“代理防火墙”,在同一个已经前端化200多个模型的端点上,在执行前对每个工具/MCP调用进行评分。我还没看到关于评分效果的独立评估,在信任其用于热路径之前,我需要知道延迟和误报数字,所以请将其视为声明而非定论。真心提问:对于那些无法撤回的操作,比如删除或支付,你们目前的关卡是什么?是测试框架中的白名单、人在环路中、代理,还是仅仅希望模型表现良好?
查看原文

相似文章