guardrails

标签

Cards List
#guardrails

我让一个代理处理太多任务,结果它以四种不同方式失败。关于防护栏和交接的AMA

Reddit r/AI_Agents · 2026-06-10

一位开发者分享了让单一AI代理处理过多任务的教训,导致多种失败模式。他们提倡拆分角色、强制结构化输出并仔细设计交接。

0 人收藏 0 人点赞
#guardrails

我用了半天的Fable 5,发现护栏才是真正的故事

Reddit r/artificial · 2026-06-10

Anthropic的Fable 5模型展现了令人印象深刻的推理和上下文处理能力,但存在高延迟、高成本以及在特定领域静默回退到Opus 4.8的问题,这可能会中断工作流程。

0 人收藏 0 人点赞
#guardrails

网络安全研究人员不满Anthropic的Fable模型的护栏

TechCrunch AI · 2026-06-10 缓存

Anthropic发布了其Fable模型,这是专注于网络安全的Mythos模型的受限版本,但网络安全研究人员批评其过于严格的护栏,甚至阻止了无害的任务。

0 人收藏 0 人点赞
#guardrails

Anthropic 为网络合作伙伴提供 Mythos 升级版,并为其他用户提供“安全”版本

Wired · 2026-06-09 缓存

Anthropic 发布了 Claude Fable 5(公开版本,带有安全防护措施)和 Claude Mythos 5(仅限合作伙伴使用),提供先进的网络安全能力,同时限制访问以防止滥用。

0 人收藏 0 人点赞
#guardrails

你究竟是如何决定哪些AI代理操作需要经过人类批准才能执行的?

Reddit r/AI_Agents · 2026-06-09

本文探讨了如何判定哪些AI代理操作需要人类审批,引用了2026年1月一起未经授权的2700万美元转账事件,并提出了基于可逆性和影响程度的评估框架。

0 人收藏 0 人点赞
#guardrails

为AI智能体构建支出授权层 — 一次设定限额,智能体无法超支

Reddit r/AI_Agents · 2026-06-08

一位开发者创建了一个MCP服务器,作为AI智能体的授权网关,强制执行支出授权,如单笔交易限额、每日/每周上限以及允许的商户,以防止超支。

0 人收藏 0 人点赞
#guardrails

“这是飓风预警”:围绕强大人工智能模型的防护措施可能为时已晚

Reddit r/ArtificialInteligence · 2026-06-07

文章讨论了人们对先进人工智能模型安全措施实施过于缓慢的担忧,认为这可能无法防止潜在的灾难性后果,并将当前形势比作飓风预警。

0 人收藏 0 人点赞
#guardrails

我构建了一个AI支持代理,其主要指标是不安全自动操作率,而不仅仅是准确性

Reddit r/AI_Agents · 2026-06-07

关于构建电信客户支持代理的技术实践,该代理优先考虑安全指标而非分类器准确性,采用了确定性访问门控、限域工具执行和路由级评估。

0 人收藏 0 人点赞
#guardrails

我的智能体在凌晨3点给老板发了邮件——防止危险工具调用的两行人工审核防护

Reddit r/AI_Agents · 2026-06-05

本文介绍了一种简单的模式,将AI智能体工具分为安全与危险两类,将发送邮件、删除文件等危险操作路由到人工审批节点,以防止意外执行。

0 人收藏 0 人点赞
#guardrails

当AI代理被赋予金融数据或你的资金的真实API访问权限时,它做过的最离谱的事情是什么?

Reddit r/AI_Agents · 2026-06-03

一位开发者讲述了这样一个故事:一个拥有真实金融API访问权限的AI代理试图幻觉出一笔批量转账到死钱包,仅因执行层的护栏阻止了它。这个故事凸显了让LLM接触真实资金的风险。

0 人收藏 0 人点赞
#guardrails

AI 在数据收集中如何遵循道德准则?

Reddit r/artificial · 2026-06-02

关于 AI 代理在生成爬虫时忽视 robots.txt 等网站规则的伦理挑战,以及 AI 提供商在不妨碍产品可用性的前提下实施护栏的责任的评论。

0 人收藏 0 人点赞
#guardrails

微软为开发者提供更好的方式来控制AI智能体行为

TechCrunch AI · 2026-06-02 缓存

微软推出了Agent Control Specification (ACS),这是一个开源标准,为开发者提供了一种统一的方式来定义和执行跨不同框架和环境的AI智能体策略。

0 人收藏 0 人点赞
#guardrails

@Pragmatic_Eng: 旧软件工程模式因编码代理而回归。Dax Raad(@thdxr),AI编码代理OpenCode的联合创始人…

X AI KOLs Following · 2026-06-01 缓存

Dax Raad,AI编码代理OpenCode的联合创始人,认为像领域驱动设计这样的旧软件工程模式正在重新变得相关,因为编码代理虽然高效,但需要更多的防护措施;这些模式曾因冗长而令人痛苦,而现在AI处理了这些冗长部分。

0 人收藏 0 人点赞
#guardrails

RiskKernel — 自托管护栏 + AI代理紧急关闭开关(你的密钥,无遥测,Apache-2.0,单一Go二进制文件)

Reddit r/AI_Agents · 2026-06-01

RiskKernel 是一个自托管的单一Go二进制文件,为AI代理强制执行严格的每次运行预算(成本、循环次数、实际时间)、紧急关闭开关和人工审批门,支持Anthropic和OpenAI提供商,且无遥测。

0 人收藏 0 人点赞
#guardrails

Meta和Google的AI护栏在几分钟内被拆除

Reddit r/ArtificialInteligence · 2026-06-01 缓存

研究人员迅速移除了广泛部署的AI模型的安全保护措施,诱发了危险输出,引发了对模型鲁棒性和发布实践的担忧。

0 人收藏 0 人点赞
#guardrails

安全护栏持续改进,但如果开源权重模型超越基于云的模型会发生什么?

Reddit r/artificial · 2026-05-31

本文探讨了开源权重模型在性能上可能超越基于云的模型的影响,同时指出安全护栏正在改进。

0 人收藏 0 人点赞
#guardrails

这些AI模型免费、私密,且永远不会说'不'

Reddit r/artificial · 2026-05-31 缓存

本文探讨了开放权重AI模型的日益普及,这些模型的安全护栏可以轻易移除,从而使它们能够无拒绝地回答有害请求,引发了关于滥用和国家安全的重大担忧。

0 人收藏 0 人点赞
#guardrails

用Go编写的小型AI助手,内置防护栏

Reddit r/AI_Agents · 2026-05-31

一个小型Go服务,用于通过Telegram和Gmail运行个人AI助手,内置防护栏和审批工作流。

0 人收藏 0 人点赞
#guardrails

在生产环境中让智能体采取真实操作,你最担心的是什么?

Reddit r/AI_Agents · 2026-05-31

一位开发者分享了在部署能够执行真实操作(如API调用和数据操作)的AI智能体时的担忧,并向社区询问他们的恐惧以及诸如护栏和人工审批等缓解策略。

0 人收藏 0 人点赞
#guardrails

我们编写了一本关于 Agentic DevOps 的开源交互式手册(如何将多智能体系统从本地笔记本迁移到生产环境)

Reddit r/artificial · 2026-05-30

一本开源交互式手册,用于构建 Agentic DevOps 流水线,涵盖多智能体系统的可观测性、基于测试的提示评估、护栏和成本控制。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈