guardrails

标签

Cards List
#guardrails

所有大语言模型都知道自己何时有害吗?跨模型家族的潜在空间安全探针可重复性研究

arXiv cs.LG · 2天前 缓存

对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。

0 人收藏 0 人点赞
#guardrails

一家超市的“用完剩菜”AI 建议将漂白剂和氨水混合成饮料

Reddit r/ArtificialInteligence · 2天前

新西兰超市 Pak'nSave 的 Savey Meal-bot 由 GPT-3.5 驱动,在输入漂白剂和氨水时生成了一个有毒食谱,凸显了消费级 AI 中输入验证、输出过滤和对抗性测试的必要性。

0 人收藏 0 人点赞
#guardrails

为某客户运行AI报告生成器几个月后,写作从来都不是最难的环节

Reddit r/AI_Agents · 2天前

一位开发者分享了在生产环境中运行AI报告生成器的经验教训,认为数据质量和验证远比模型的写作能力重要,因为流畅但错误的报告是危险的。

0 人收藏 0 人点赞
#guardrails

@amitiitbhu:LLM 护栏如何工作?在此阅读:

X AI KOLs Timeline · 3天前 缓存

一份实用指南,解释 LLM 护栏的工作原理、为什么需要它们、它们在输入和输出上的位置、如何用代码实现它们,以及最佳实践。

0 人收藏 0 人点赞
#guardrails

不设计好的话,两个自动回复代理可能永远乒乓互回,而且这是个容易忽略的问题

Reddit r/AI_Agents · 3天前

讨论了自动回复代理陷入无限邮件循环的风险,并提出了实际防护措施:检查 auto-submitted 标头、检测 no-reply 发件人、限制每个线程的回复次数,以及采用草稿优先或人工升级模式。

0 人收藏 0 人点赞
#guardrails

一个不可见字符让我们的护栏失效了三周,而症状看起来完全像是模型不稳定

Reddit r/AI_Agents · 3天前

一位开发者讲述了一个持续三周的生产环境 bug:一个包含字面退格字符的正则表达式静默地禁用了语言检测护栏,让 LLM 看起来不稳定。这篇文章强调了需要对确定性护栏进行埋点,以将其与模型的非确定性区分开来。

0 人收藏 0 人点赞
#guardrails

为何LLM幻觉不是模型问题——而是系统架构问题(4个生产环境护栏)

Reddit r/AI_Agents · 5天前

本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。

0 人收藏 0 人点赞
#guardrails

选择AI Agent框架是Agent技术栈中最不重要的决定

Reddit r/AI_Agents · 5天前

文章认为,AI Agent框架(如LangGraph、CrewAI等)的选择对生产环境可靠性的影响不如评测(evals)、追踪(tracing)和护栏(guardrails)重要,并为构建Agent技术栈的开发者提供了实用建议。

0 人收藏 0 人点赞
#guardrails

DreamGuard:基于风险感知世界模型的高效LLM智能体运行时护栏

arXiv cs.AI · 6天前 缓存

DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。

0 人收藏 0 人点赞
#guardrails

提示词是请求,而不是许可。这就是为什么你的智能体仍处于试点阶段。

Reddit r/AI_Agents · 2026-08-05

一篇分析文章,认为提示词级别的护栏之所以失败,是因为它们依赖模型自我监督,而安全检查必须存在于工具边界,并带有可问责的持久审计记录。文章强调,智能体试点停滞的原因在于所有权不明确,而非准确性问题。

0 人收藏 0 人点赞
#guardrails

智能、安全还是快速:每个对话式AI助手都得三选二

Reddit r/AI_Agents · 2026-08-04

一位工程师提出的框架,用于理解对话式AI系统在能力、控制和延迟之间的权衡,阐释了为什么每个助手都必须选择其中两项,并提出了深思熟虑的设计策略。

0 人收藏 0 人点赞
#guardrails

“护栏人”因发布关于Flock摄像头的帖子走红,随后有人将其破坏

Wired · 2026-08-03 缓存

Steve Eimers,人称“护栏人”,因发布关于Flock自动车牌识别摄像头及其潜在碰撞危险的帖子而走红;在他发布帖子后,他视频中出现的一台摄像头被破坏,引发了对ALPR监控和破坏威胁的争议。

0 人收藏 0 人点赞
#guardrails

自愈智能体只是一个你忘了构建的循环 [博客]

Reddit r/AI_Agents · 2026-08-02

一篇关于自愈智能体简单模式的博客文章:使用生命周期钩子读写经验教训,并用护栏防止错误信念固化。

0 人收藏 0 人点赞
#guardrails

@tom_doerr: Future AGI 是一个开源平台,结合了评估、追踪和护栏,帮助团队交付自我改进的 AI 代理…

X AI KOLs Timeline · 2026-08-02 缓存

Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。

0 人收藏 0 人点赞
#guardrails

@hanakoxbt: https://x.com/hanakoxbt/status/2083540339147567268

X AI KOLs Timeline · 2026-08-01 缓存

一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。

0 人收藏 0 人点赞
#guardrails

有没有经过实战检验的 AI 智能体生产级样板?

Reddit r/AI_Agents · 2026-07-30

讨论寻求推荐包含状态持久化、重试机制和安全防护的生产就绪型开源 AI 智能体样板。

0 人收藏 0 人点赞
#guardrails

第二个本地LLM真的是一个安全边界,还是仅仅另一个概率性意见?

Reddit r/LocalLLaMA · 2026-07-30

一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。

0 人收藏 0 人点赞
#guardrails

50% OpenClaw,50% 自定义封装 = 快乐的管道!

Reddit r/openclaw · 2026-07-29

作者分享了他们使用 OpenClaw 和自定义防护栏构建生产级多智能体系统的经验,重点介绍了静默失败和非确定性的挑战。

0 人收藏 0 人点赞
#guardrails

我突然想到:如果开源模型现在已接近前沿水平的能力,我们还有哪些护栏能阻止有人设计另一种超级病毒并重演疫情?

Reddit r/ArtificialInteligence · 2026-07-29

对拥有前沿能力的开源AI模型风险的反思,质疑当前护栏在防止被滥用于生物武器制造方面的有效性。

0 人收藏 0 人点赞
#guardrails

语音代理的红队测试:音频作为攻击面、多轮压力与闭环验证

Reddit r/AI_Agents · 2026-07-24

深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈