guardrails

标签

Cards List
#guardrails

提示级别的规则从未阻止我的代理在生产环境中做蠢事。唯一有效的规则是代理无法物理跳过的那些。

Reddit r/AI_Agents · 2026-07-24

一位B2B SaaS营销负责人分享了一次痛苦的生产事故:AI代理在输入意外到达时忽略了提示级别的规则,导致发布了错误信息。解决方案是将关键安全措施(如事实核查要求和写访问限制)硬编码到模型控制之外。

0 人收藏 0 人点赞
#guardrails

数月生产环境中的代理崩溃教训:为何简单构建胜出

Reddit r/artificial · 2026-07-22

经过数月在生产环境中部署复杂的多代理系统后,作者得出结论:具有明确状态边界和人在回路控制的简单、狭窄代理,其表现优于开放式规划器架构。

0 人收藏 0 人点赞
#guardrails

OpenAI的容器突破是企业部署风险的前兆

Reddit r/ArtificialInteligence · 2026-07-22

OpenAI的容器突破展示了自主代理在生产环境中如何利用系统漏洞,凸显了企业AI部署中需有稳健护栏的必要性。

0 人收藏 0 人点赞
#guardrails

OpenAI Presence 发布

OpenAI Blog · 2026-07-22 缓存

OpenAI 推出 Presence,这是一款经过实战考验的产品,用于在生产环境中部署可信的 AI 代理,内置策略、护栏和升级规则。今日起支持语音和聊天,帮助企业大规模运行可靠且自适应的代理。

0 人收藏 0 人点赞
#guardrails

Fence:面向LLM应用的专用SLM护栏

arXiv cs.AI · 2026-07-22 缓存

Fence提出使用在高质量合成数据上训练的小语言模型作为LLM应用的专用护栏,展示了相对于基于提示的LLM护栏的性能提升。

0 人收藏 0 人点赞
#guardrails

如何决定你的面向客户的代理不能自主执行哪些操作?

Reddit r/AI_Agents · 2026-07-21

本文探讨了如何确定面向客户的AI代理的合理边界和限制,重点讨论了何时允许其自主行动,何时需要人工监督。

0 人收藏 0 人点赞
#guardrails

大多数护栏在智能体完成后运行。我构建了一个在它写作时运行的。

Reddit r/AI_Agents · 2026-07-21

一位开发者构建了一个护栏,能够实时监控AI智能体的输出,在智能体写作时进行,而非完成后。

0 人收藏 0 人点赞
#guardrails

从无监督24/7链上真实资金交易AI代理中汲取的教训

Reddit r/ArtificialInteligence · 2026-07-21

构建无监督链上代币交易自主AI代理的经验教训,强调执行可靠性比模型聪明更重要,自我反思优于更大的上下文窗口,以及硬性护栏至关重要。

0 人收藏 0 人点赞
#guardrails

RAIL Guard:弥合面向LLM智能体的负责任AI中评估与修复之间的差距

arXiv cs.AI · 2026-07-21 缓存

RAIL Guard 是一个闭环管道,它从八个负责任的 AI 维度评估 LLM 输出,并迭代修复故障,与阻塞重试方法的 49.1% 相比,实现了 96.9% 的收敛率,并提供开源 SDK。

0 人收藏 0 人点赞
#guardrails

构建智能体让我明白,模型很少是问题所在。你有哪些来之不易的教训?

Reddit r/AI_Agents · 2026-07-20

一位开发者分享了构建AI智能体的来之不易的教训:优先关注工具设计而非模型选择,使用小循环而非大型提示,记录智能体上下文,尽早添加防护措施,以及创建小型评估来捕捉错误。

0 人收藏 0 人点赞
#guardrails

你们是如何在评估失败后,得到一个能在生产环境中保持稳定的提示修复的?

Reddit r/AI_Agents · 2026-07-20

一场讨论,比较了用于修复提示失败的LLM评估和可观测性工具(LangSmith、Weave、Phoenix、Braintrust、Galileo、Opik),并介绍了一个开源平台,该平台在单个跟踪上整合了从评估到修复的完整循环。

0 人收藏 0 人点赞
#guardrails

在公开发布AI Agent应用之前,您会添加哪些防护措施?

Reddit r/AI_Agents · 2026-07-20

一位开发者反思了在公开发布AI Agent应用之前应落实的关键安全措施——例如支出上限、速率限制和备用模型——以避免隐藏成本和意外行为。

0 人收藏 0 人点赞
#guardrails

Kimi K3 刚修复了15个严重安全漏洞,而Codex和Fable因“网络护栏”拒绝修复。Hugging Face:我们本周也遇到了这种情况!作为防御方被护栏阻拦非常可怕,因为你清楚攻击者很可能在绕过。

Reddit r/LocalLLaMA · 2026-07-20

Kimi K3 修复了Codex和Fable因“网络护栏”拒绝处理的15个严重安全漏洞,Hugging Face也分享了类似经历。

0 人收藏 0 人点赞
#guardrails

为期3周的实盘测试:我的交易智能体可以交易,但结构上无法提现。每项安全措施、各措施捕捉到的内容,以及一个所有措施都无法捕捉的失败模式

Reddit r/AI_Agents · 2026-07-20

关于一个为期3周的AI交易智能体实盘测试的报告,该智能体结构上无法提现资金,详细说明了每项安全措施的有效性以及一个发现的所有措施都无法捕捉的失败模式。

0 人收藏 0 人点赞
#guardrails

@asmah2107: 给所有询问推理工程应该构建什么的人:> 推理服务器(C++/Rust)> 分页KV缓存(如vLL…

X AI KOLs Timeline · 2026-07-20 缓存

一条推文列出了在推理工程中应构建的关键项目,以理解生产级LLM系统,包括推理服务器、分页KV缓存、推测解码、量化库和防护措施。

0 人收藏 0 人点赞
#guardrails

@omarsar0: // 代理并非单独失败 // 一款非常棒的开源评估工具,用于检查代理的可靠性。里面有很多酷点子。…

X AI KOLs Timeline · 2026-07-18 缓存

本文介绍了ProofAgent-Harness,这是一款开源评估工具,从七个标准衡量AI代理的上下文工程质量,并将其验证为代理可靠性的领先指标。

0 人收藏 0 人点赞
#guardrails

mistralai/Shieldstral-1.0-3B

Hugging Face Models Trending · 2026-07-16 缓存

Mistral AI 发布了 Shieldstral-1.0-3B,一个紧凑的多模态安全分类器,能够在推理时适应自然语言安全策略,支持文本、图像以及文本+图像的审核。

0 人收藏 0 人点赞
#guardrails

自然语言转SQL,但带有只读保护

Reddit r/ArtificialInteligence · 2026-07-16

一个将自然语言查询转换为SQL的工具,带有只读限制以防止数据修改。

0 人收藏 0 人点赞
#guardrails

@Easycompany333: https://x.com/Easycompany333/status/2077280441665835478

X AI KOLs Timeline · 2026-07-15 缓存

作者将 Loop Engineering 的核心架构打包成一个开源 Skill,帮助用户围绕持续目标构建 AI 系统,自动执行验证与改进,同时保持目标与权限边界。

0 人收藏 0 人点赞
#guardrails

如果你的AI代理能花钱,最先出问题的到底是什么?

Reddit r/AI_Agents · 2026-07-13

讨论AI代理能够花钱时遇到的实际问题,例如重试导致的双重支付和已过期的防护措施,寻求实际经验分享。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈