guardrails

标签

Cards List
#guardrails

@shmidtqq: OpenAI发布了一份34页的构建AI智能体指南。整份指南归结为一个理念:智能体就是一个循环。运行模型…

X AI KOLs Timeline · 2026-06-28 缓存

OpenAI发布了一份34页的构建AI智能体指南,强调智能体本质上是一个循环:运行模型、调用工具、反馈结果、重复直到满足退出条件。指南涵盖了工具、护栏以及从单个循环开始再扩展到多个智能体的方法。

0 人收藏 0 人点赞
#guardrails

@dabit3: 现在智能体可以行动了,我们需要问:它们何时运行,可以接触什么,工作如何被检查,以及它们获得什么上下文……

X AI KOLs Following · 2026-06-27 缓存

作者提出将自动化工程作为一门学科,用于设计触发器、护栏和成功检查,使AI智能体能够安全可靠地运行,无需持续的人类监督。

0 人收藏 0 人点赞
#guardrails

安全护栏需要推理吗?LeanGuard:一种快速轻量的鲁棒审核方法

arXiv cs.AI · 2026-06-26 缓存

本文介绍了LeanGuard,一种基于轻量级双向编码器的安全护栏,在匹配更大规模推理式护栏精度的同时,速度提升约100倍,挑战了“链式推理对于有效审核必不可少”的假设。

0 人收藏 0 人点赞
#guardrails

代理演示看起来很惊艳,因为没人拍那90%的错误处理部分

Reddit r/AI_Agents · 2026-06-25

作者将精心打磨的AI代理演示与生产系统的现实进行对比,指出大多数代理代码用于错误处理和护栏(guardrails),而非核心智能。

0 人收藏 0 人点赞
#guardrails

护栏扼杀了创造力?

Reddit r/singularity · 2026-06-25

一位用户担心当前AI模型由于安全护栏而变得缺乏创造力且更显企业腔调,与早期更具想象力的开放模型形成对比。

0 人收藏 0 人点赞
#guardrails

AI代理需要安全层才能获得企业信任

Reddit r/AI_Agents · 2026-06-25

本文介绍了一种针对AI代理的护栏平台,该平台提供控制层,用于阻止恶意提示、幻觉、危险操作和成本激增,从而在企业环境中实现安全的自主AI。

0 人收藏 0 人点赞
#guardrails

你的AI代理在生产环境中未经询问就做的最糟糕的事情是什么?

Reddit r/AI_Agents · 2026-06-24

关于自主AI代理在生产环境中实际失败案例的讨论,例如发送未经授权的电子邮件、修改记录、删除数据、花费金钱等,寻求经验和防护措施。

0 人收藏 0 人点赞
#guardrails

Java团队如何为AI生成的代码设置防护措施?

Reddit r/AI_Agents · 2026-06-24

本文探讨了Java开发团队如何建立防护措施和最佳实践,以管理AI生成代码的质量、安全性和可靠性。

0 人收藏 0 人点赞
#guardrails

@levie:智能体使用软件的频率将比人类高出100倍。当这种情况发生时,就需要对智能体的行为设置护栏,以防止数据泄露或修改错误信息,需要权威的数据源供其使用,需要日志记录和审计其操作,还需要通过这些系统与人类协作的能力,等等。

X AI KOLs Following · 2026-06-22 缓存

Box首席执行官Aaron Levie认为,AI智能体使用软件的频率将比人类高出100倍,因此需要设置护栏、权威数据源、日志记录和协作功能;能够支持无头交互的平台将占据最佳优势。

0 人收藏 0 人点赞
#guardrails

如果您的智能体执行了不可逆操作(交易、发送资金),则需要在决策与操作之间设置一个确定性护栏工具。

Reddit r/AI_Agents · 2026-06-21

在AI智能体的决策与其不可逆操作(如交易或发送资金)之间,需要设置一个确定性护栏工具以确保安全。

0 人收藏 0 人点赞
#guardrails

特朗普政府要求Fable 5拥有牢不可破的护栏 | 也就是他们在要求不可能的事

Reddit r/singularity · 2026-06-18

特朗普政府要求Fable 5拥有牢不可破的护栏,这一要求被描述为不可能。

0 人收藏 0 人点赞
#guardrails

我的团队一天内上线了一个能处理技术债务的AI代理。最难的部分不是代码,而是把问题定义得足够清晰,让代理能够接手执行。

Reddit r/AI_Agents · 2026-06-17

一个团队构建了AI代理来自动修复技术债务:扫描代码库、自动提交PR。他们发现最困难的是精确定义问题,此外还讨论了多个代理在同一代码库上运行时的冲突问题以及设置防护栏的必要性。

0 人收藏 0 人点赞
#guardrails

构建AI代理工具调用的开源执行层

Reddit r/AI_Agents · 2026-06-15

介绍Faramesh,一个开源运行时执行层,用于AI代理工具调用,在操作执行前检查策略,提供超越可观测性或LLM评判的解决方案。

0 人收藏 0 人点赞
#guardrails

@OrcaRouter: Fable 5 已死。我们刚刚将其复活——更便宜、更开放,密钥由你掌握。OpenRouter 在 48 小时前取消了 Fusion,而且……

X AI KOLs Timeline · 2026-06-15 缓存

OrcaRouter 是一个新的 AI 网关,它智能地将提示路由到最佳模型,提供成本节省、护栏和完全可观测性,零代币加价并有免费层级。

0 人收藏 0 人点赞
#guardrails

@Alifkhanzxx: 一位谷歌高级工程师刚刚发布了一份421页的文档,名为“Agentic Design Patterns”。每一章都有代码支持,并涵盖…

X AI KOLs Timeline · 2026-06-13

一位谷歌高级工程师免费发布了一份421页的文档,涵盖AI系统的代理设计模式,包括基于代码的章节,涉及提示链、多代理协调、防护栏和推理。

0 人收藏 0 人点赞
#guardrails

我把我的AI代理治理平台上线了。来试试攻破它。

Reddit r/artificial · 2026-06-12

作者发布了Bendex Arc,一个面向AI代理的开源治理层,用于强制权限、阻止操控,并包含一个用于测试的实时演示。

0 人收藏 0 人点赞
#guardrails

Fable 5 的护栏在48小时内被绕过。这对构建面向客户的AI的人来说意味着什么。

Reddit r/artificial · 2026-06-12

Anthropic的Claude Fable 5安全护栏在48小时内被绕过,使用了Unicode替换和多轮分解等技术,突显了无状态分类器的弱点以及持续对抗性测试的必要性。

0 人收藏 0 人点赞
#guardrails

Anthropic为隐形Claude Fable护栏道歉

The Verge · 2026-06-11 缓存

Anthropic为其新Claude Fable 5模型秘密限制速度并设置针对蒸馏尝试的隐藏护栏而道歉,现在将让安全措施可见,并将被标记的查询路由到较旧模型。

0 人收藏 0 人点赞
#guardrails

Claude Fable 无法回答基础生物学问题

The Verge · 2026-06-10 缓存

Anthropic 新发布的 Claude Fable 5 模型因过于保守的安全过滤器拒绝回答基础生物学问题,这些过滤器旨在防止生物武器滥用,凸显了能力与安全性之间的权衡。

0 人收藏 0 人点赞
#guardrails

我们正在部署AI代理,我希望在遵守NIS2/DORA法规的前提下进行。

Reddit r/AI_Agents · 2026-06-10

本文讨论了在金融领域部署AI代理,同时确保符合NIS2/DORA法规要求,重点关注透明度、防护措施以及潜在数据泄露时的责任归属。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈