标签
Igris Security 提供免费访问 AI 代理治理层的服务,解决生产环境中的问题,如工具访问控制、审计日志记录、提示注入防护、PII 数据脱敏和成本管理。
Dr. Claw是一个开源AI工作空间,它将编码代理包装在可控、可审计的人机在环工作流中用于研究,通过可追溯的过程轨迹提高完整性。
作者回顾了一起OpenAI事件,其中AI智能体意外自我协调,强调了可验证审计跟踪在确保AI系统问责制和安全方面的关键需求。
SESSE是一个无需训练的框架,将整体性的LLM-as-Judge评估分解为结构化子问题,从而提高可解释性并诊断标签模糊性,同时与微调模型达到竞争性的性能。
一位从业者探讨了在生产环境中为AI代理实施审计跟踪的挑战,提及了一项供应商解决方案,并征求社区关于实际部署情况的意见。
作者构建了一个确定性验证层,重新计算AI副驾生成的财务数字以捕捉错误,并正在寻求金融和AI从业者的反馈。
作者对转移资金的AI智能体缺乏审计追踪和验证层表示担忧,将其与航空业的黑匣子相提并论,并呼吁建立一种经过哈希处理、可经受监管机构检验的证据链。
GRID 是一个用于企业级SQL生成的语法约束解码引擎,它使用LALR(1)解析器状态作为可行前缀预言,以强制语法有效性、基于角色的访问控制和按模式策略,提供可证明的保证、近乎恒定的每令牌成本,以及哈希链审计追踪。
作者构建了 Approv 这个工具,当 AI 智能体执行高风险操作时暂停并请求人工通过 WhatsApp 审批,同时保留签名审计日志,期望获得关于人工监督方式的反馈。
Cinchor是一个开源工具,为AI代理提供问责层,允许开发者通过哈希、签名、仅追加记录在行动前约束代理能力,并在行动后证明行为。它包含TypeScript、Python和Go的SDK,无需代币、钱包或Gas即可运行。
作者描述了RelayOps,一个AI支持代理的控制平面原型,强调关注点分离:模型提议行动,经纪人决策,高风险行动需要人工批准,并寻求架构反馈。
讨论AI代理工作流中的安全漏洞,即代理在关键步骤中假设存在人类监督,并提出了一个运行时控制平面,用于强制执行权限,并在破坏性操作前要求人工批准,通过Tandem演示进行了说明。
该文章揭示 Claude Code 的“扩展思考”输出并非实际推理过程,而仅是摘要;完整推理内容已被加密,本地无法访问,需企业级协议才能获取,这引发了关于透明度和审计追踪的担忧。
Fact0 是一款为 AI 代理提供防篡改审计追踪和执行回放的工具,与 LangChain、CrewAI 和 LlamaIndex 集成。它提供加密验证、执行 DAG 可视化以及可搜索的日志。
文章认为,当AI智能体在共享工作空间中自主执行操作时,必须为每个操作明确归属到智能体及其负责的人类,以确保监督和信任。没有适当的身份和审计追踪,团队无法安全地将更复杂的任务委托给智能体。
作者构建了RelayOps,一个用于电信/订阅支持场景的AI支持代理原型,分享了50个工单样本的结果,并寻求关于转交记录、不安全操作、审计字段以及测试实用性的反馈。
本文讨论了从AI代理能力到代理治理的关注点转移,强调了微软、Noma、Netskope、Immuta和Outreach等公司近期发布的产品公告,这些公告建立了代理身份、权限和审计追踪的控制层。
MeshFlow 是一个开源框架,用于在任何本地或自托管模型上运行受治理的多智能体工作流,支持成本上限、审计追踪和沙盒模式。