标签
OpenAI发布了一份34页的构建AI智能体指南,强调智能体本质上是一个循环:运行模型、调用工具、反馈结果、重复直到满足退出条件。指南涵盖了工具、护栏以及从单个循环开始再扩展到多个智能体的方法。
作者提出将自动化工程作为一门学科,用于设计触发器、护栏和成功检查,使AI智能体能够安全可靠地运行,无需持续的人类监督。
本文介绍了LeanGuard,一种基于轻量级双向编码器的安全护栏,在匹配更大规模推理式护栏精度的同时,速度提升约100倍,挑战了“链式推理对于有效审核必不可少”的假设。
作者将精心打磨的AI代理演示与生产系统的现实进行对比,指出大多数代理代码用于错误处理和护栏(guardrails),而非核心智能。
本文介绍了一种针对AI代理的护栏平台,该平台提供控制层,用于阻止恶意提示、幻觉、危险操作和成本激增,从而在企业环境中实现安全的自主AI。
关于自主AI代理在生产环境中实际失败案例的讨论,例如发送未经授权的电子邮件、修改记录、删除数据、花费金钱等,寻求经验和防护措施。
Box首席执行官Aaron Levie认为,AI智能体使用软件的频率将比人类高出100倍,因此需要设置护栏、权威数据源、日志记录和协作功能;能够支持无头交互的平台将占据最佳优势。
在AI智能体的决策与其不可逆操作(如交易或发送资金)之间,需要设置一个确定性护栏工具以确保安全。
特朗普政府要求Fable 5拥有牢不可破的护栏,这一要求被描述为不可能。
一个团队构建了AI代理来自动修复技术债务:扫描代码库、自动提交PR。他们发现最困难的是精确定义问题,此外还讨论了多个代理在同一代码库上运行时的冲突问题以及设置防护栏的必要性。
介绍Faramesh,一个开源运行时执行层,用于AI代理工具调用,在操作执行前检查策略,提供超越可观测性或LLM评判的解决方案。
OrcaRouter 是一个新的 AI 网关,它智能地将提示路由到最佳模型,提供成本节省、护栏和完全可观测性,零代币加价并有免费层级。
一位谷歌高级工程师免费发布了一份421页的文档,涵盖AI系统的代理设计模式,包括基于代码的章节,涉及提示链、多代理协调、防护栏和推理。
作者发布了Bendex Arc,一个面向AI代理的开源治理层,用于强制权限、阻止操控,并包含一个用于测试的实时演示。
Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。
Anthropic为其新Claude Fable 5模型秘密限制速度并设置针对蒸馏尝试的隐藏护栏而道歉,现在将让安全措施可见,并将被标记的查询路由到较旧模型。
Anthropic 新发布的 Claude Fable 5 模型因过于保守的安全过滤器拒绝回答基础生物学问题,这些过滤器旨在防止生物武器滥用,凸显了能力与安全性之间的权衡。
本文讨论了在金融领域部署AI代理,同时确保符合NIS2/DORA法规要求,重点关注透明度、防护措施以及潜在数据泄露时的责任归属。