guardrails

标签

Cards List
#guardrails

不设计好的话,两个自动回复代理可能永远乒乓互回,而且这是个容易忽略的问题

Reddit r/AI_Agents · 10小时前

讨论了自动回复代理陷入无限邮件循环的风险,并提出了实际防护措施:检查 auto-submitted 标头、检测 no-reply 发件人、限制每个线程的回复次数,以及采用草稿优先或人工升级模式。

0 人收藏 0 人点赞
#guardrails

一个不可见字符让我们的护栏失效了三周,而症状看起来完全像是模型不稳定

Reddit r/AI_Agents · 12小时前

一位开发者讲述了一个持续三周的生产环境 bug:一个包含字面退格字符的正则表达式静默地禁用了语言检测护栏,让 LLM 看起来不稳定。这篇文章强调了需要对确定性护栏进行埋点,以将其与模型的非确定性区分开来。

0 人收藏 0 人点赞
#guardrails

为何LLM幻觉不是模型问题——而是系统架构问题(4个生产环境护栏)

Reddit r/AI_Agents · 2天前

本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。

0 人收藏 0 人点赞
#guardrails

选择AI Agent框架是Agent技术栈中最不重要的决定

Reddit r/AI_Agents · 2天前

文章认为,AI Agent框架(如LangGraph、CrewAI等)的选择对生产环境可靠性的影响不如评测(evals)、追踪(tracing)和护栏(guardrails)重要,并为构建Agent技术栈的开发者提供了实用建议。

0 人收藏 0 人点赞
#guardrails

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 3天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
#guardrails

提示词是请求,而不是许可。这就是为什么你的智能体仍处于试点阶段。

Reddit r/AI_Agents · 4天前

一篇分析文章,认为提示词级别的护栏之所以失败,是因为它们依赖模型自我监督,而安全检查必须存在于工具边界,并带有可问责的持久审计记录。文章强调,智能体试点停滞的原因在于所有权不明确,而非准确性问题。

0 人收藏 0 人点赞
#guardrails

智能、安全还是快速:每个对话式AI助手都得三选二

Reddit r/AI_Agents · 5天前

一位工程师提出的框架,用于理解对话式AI系统在能力、控制和延迟之间的权衡,阐释了为什么每个助手都必须选择其中两项,并提出了深思熟虑的设计策略。

0 人收藏 0 人点赞
#guardrails

“护栏人”因发布关于Flock摄像头的帖子走红,随后有人将其破坏

Wired · 6天前 缓存

Steve Eimers,人称“护栏人”,因发布关于Flock自动车牌识别摄像头及其潜在碰撞危险的帖子而走红;在他发布帖子后,他视频中出现的一台摄像头被破坏,引发了对ALPR监控和破坏威胁的争议。

0 人收藏 0 人点赞
#guardrails

自愈智能体只是一个你忘了构建的循环 [博客]

Reddit r/AI_Agents · 2026-08-02

一篇关于自愈智能体简单模式的博客文章:使用生命周期钩子读写经验教训,并用护栏防止错误信念固化。

0 人收藏 0 人点赞
#guardrails

@tom_doerr: Future AGI 是一个开源平台,结合了评估、追踪和护栏,帮助团队交付自我改进的 AI 代理…

X AI KOLs Timeline · 2026-08-02 缓存

Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。

0 人收藏 0 人点赞
#guardrails

@hanakoxbt: https://x.com/hanakoxbt/status/2083540339147567268

X AI KOLs Timeline · 2026-08-01 缓存

一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。

0 人收藏 0 人点赞
#guardrails

有没有经过实战检验的 AI 智能体生产级样板?

Reddit r/AI_Agents · 2026-07-30

讨论寻求推荐包含状态持久化、重试机制和安全防护的生产就绪型开源 AI 智能体样板。

0 人收藏 0 人点赞
#guardrails

第二个本地LLM真的是一个安全边界,还是仅仅另一个概率性意见?

Reddit r/LocalLLaMA · 2026-07-30

一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。

0 人收藏 0 人点赞
#guardrails

50% OpenClaw,50% 自定义封装 = 快乐的管道!

Reddit r/openclaw · 2026-07-29

作者分享了他们使用 OpenClaw 和自定义防护栏构建生产级多智能体系统的经验,重点介绍了静默失败和非确定性的挑战。

0 人收藏 0 人点赞
#guardrails

我突然想到:如果开源模型现在已接近前沿水平的能力,我们还有哪些护栏能阻止有人设计另一种超级病毒并重演疫情?

Reddit r/ArtificialInteligence · 2026-07-29

对拥有前沿能力的开源AI模型风险的反思,质疑当前护栏在防止被滥用于生物武器制造方面的有效性。

0 人收藏 0 人点赞
#guardrails

语音代理的红队测试:音频作为攻击面、多轮压力与闭环验证

Reddit r/AI_Agents · 2026-07-24

深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。

0 人收藏 0 人点赞
#guardrails

提示级别的规则从未阻止我的代理在生产环境中做蠢事。唯一有效的规则是代理无法物理跳过的那些。

Reddit r/AI_Agents · 2026-07-24

一位B2B SaaS营销负责人分享了一次痛苦的生产事故:AI代理在输入意外到达时忽略了提示级别的规则,导致发布了错误信息。解决方案是将关键安全措施(如事实核查要求和写访问限制)硬编码到模型控制之外。

0 人收藏 0 人点赞
#guardrails

数月生产环境中的代理崩溃教训:为何简单构建胜出

Reddit r/artificial · 2026-07-22

经过数月在生产环境中部署复杂的多代理系统后,作者得出结论:具有明确状态边界和人在回路控制的简单、狭窄代理,其表现优于开放式规划器架构。

0 人收藏 0 人点赞
#guardrails

OpenAI的容器突破是企业部署风险的前兆

Reddit r/ArtificialInteligence · 2026-07-22

OpenAI的容器突破展示了自主代理在生产环境中如何利用系统漏洞,凸显了企业AI部署中需有稳健护栏的必要性。

0 人收藏 0 人点赞
#guardrails

OpenAI Presence 发布

OpenAI Blog · 2026-07-22 缓存

OpenAI 推出 Presence,这是一款经过实战考验的产品,用于在生产环境中部署可信的 AI 代理,内置策略、护栏和升级规则。今日起支持语音和聊天,帮助企业大规模运行可靠且自适应的代理。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈