guardrails

标签

Cards List
#guardrails

CG-Probes: 从患者查询嵌入中恢复护栏方向

arXiv cs.CL ↗ · 6小时前 缓存

本文提出了临床护栏探针 (CG-Probes),通过利用线性探测方法从查询嵌入中恢复护栏方向,来衡量面向肿瘤学患者的AI助手的风险。

0 人收藏 0 人点赞
#guardrails

在生产环境中,你是如何阻止代理执行不当操作的?

Reddit r/AI_Agents ↗ · 昨天

本文讨论了防止AI代理在生产环境中执行有害操作的策略,介绍了axonpush作为根据条件阻止工具调用的工具,并探讨了流式响应的挑战。

0 人收藏 0 人点赞
#guardrails

无代码代理现在很容易构建。人们如何在生产环境中防止它们做蠢事?

Reddit r/AI_Agents ↗ · 4天前

本文讨论了构建无代码AI代理的便利性,并提出了关于在生产环境中实施防护措施和治理以防止错误的问题。

0 人收藏 0 人点赞
#guardrails

SaaS 将成为代理的控制层和观察窗口。

Reddit r/AI_Agents ↗ · 5天前

企业级 SaaS 的未来正转向为 AI 代理提供护栏、权限和可见性,实现安全操作和监督。企业将内部开发此基础设施,或采用基于云的平台。

0 人收藏 0 人点赞
#guardrails

@cryptowluha: 这5项技能能让你的代理在几秒钟内变成顶尖的导师、YouTuber和创始人的得力助手

X AI KOLs Timeline ↗ · 5天前 缓存

这篇文章介绍了五个基于GitHub的技能,适用于AI代理,使它们能够担任导师、管理YouTube工作流、设计平台、添加防护措施,并协助创始人处理日常任务。

0 人收藏 0 人点赞
#guardrails

我将我的ADK工程经验打包成编码代理技能

Reddit r/AI_Agents ↗ · 6天前

本文介绍了一个免费开源的编码代理技能集合,专为Google Cloud上的Google ADK设计,旨在帮助编码助手实现记忆、部署、防护栏等功能。

0 人收藏 0 人点赞
#guardrails

Jev 的一些有趣颠覆性用例,欢迎补充。

Reddit r/AI_Agents ↗ · 6天前

本文介绍了 Jev 的几个颠覆性用例,这个工具可应用于 AI 评估、语音 AI、工作流、合成角色等,为各种 AI 任务提供快速且可量化的解决方案。

0 人收藏 0 人点赞
#guardrails

AI护栏

Reddit r/ArtificialInteligence ↗ · 2026-09-20

本文讨论了在人工智能中实施护栏的重要性,以确保安全和伦理合规。

0 人收藏 0 人点赞
#guardrails

超越交互界面的安全性:基于大型语言模型潜在状态的有害内容检测

arXiv cs.AI ↗ · 2026-09-18 缓存

本文提出通过轻量级MLP探测器分析LLaMA-3.1-8B的激活状态,以高F1分数检测有害提示,为大型外部护栏模型提供了一种经济高效的替代方案。

0 人收藏 0 人点赞
#guardrails

目前,关于大语言模型的“去审查”(uncensoring)方法主要有以下几种常见方向,它们各有优劣,且通常涉及技术调整与伦理考量的平衡: 1. **微调(Fine-tuning)**:在经过审查的数据集上对模型进行二次训练,使用移除或修改了限制内容的文本数据,以调整模型的输出倾向。这是最直接的方法,但需要足够的计算资源和合适的训练数据。 2. **提示工程(Prompt Engineering)**:通过精心设计的指令(prompts)或角色扮演(如“假设你是一个不受限制的AI”),尝试引导模型绕过内置的安全限制。此方法无需修改模型本身,但效果不稳定,且可能被后续的更新或安全层所阻断。 3. **参数调整(Parameter Adjustment)**:调整模型的采样参数,如温度(temperature)、top-k、top-p等,使输出更多样化或更随机,有时可能产生更不受限的回复。这是一种轻量级方法,但对核心的审查机制影响有限。 4. **模型合并与修改(Model Merging/Modification)**:将多个模型(例如一个基础模型和一个经过微调的“无审查”模型)的权重进行合并,或直接修改模型架构中的安全层。这种方法技术门槛较高。 **重要提示**:所谓“最佳”方法高度取决于具体模型(如LLaMA、Mistral等)、应用场景以及用户对“无审查”的定义。目前没有一种方法能完美、稳定且安全地移除所有限制,且大多数方法都可能违反模型的使用条款或带来滥用风险。在实践中,负责任地使用AI并遵守服务条款仍是首要原则。

Reddit r/LocalLLaMA ↗ · 2026-09-16

本文探讨了解除本地大型语言模型限制的最佳方法,重点分析了护栏机制的影响,并寻求社区在使用“清除”和“异端”等方法方面的实践经验。

0 人收藏 0 人点赞
#guardrails

@BillKristol: AI‘护栏’一词。没有牙齿的护栏——没有执行机制、没有责任、没有处罚……

X AI KOLs Following ↗ · 2026-09-15 缓存

Bill Kristol认为,AI护栏必须包括执行机制、责任和政府支持才能有效。

0 人收藏 0 人点赞
#guardrails

围绕GPT-3.5 Turbo构建代理框架所教会我的:每一个修复都是代码,而非提示

Reddit r/AI_Agents ↗ · 2026-09-14

作者分享了为GPT-3.5 Turbo构建代理框架的见解,强调基于代码的验证和防护措施对于可靠的AI代理性能至关重要。

0 人收藏 0 人点赞
#guardrails

引用Boris Cherny

Simon Willison's Blog ↗ · 2026-09-11 缓存

Boris Cherny 强调在使用像Claude这样的AI模型处理生产代码时,需要更高的标准和防护措施,以保持质量并避免维护问题。

0 人收藏 0 人点赞
#guardrails

你们如何保障能够实际操作资金的AI自主代理的安全?

Reddit r/AI_Agents ↗ · 2026-09-11

本文介绍了一个面向自主代理的免费信任层,它通过执行委托来防止未经授权的金融交易,使用TSS/MPC进行安全签名和不可变的审计跟踪。

0 人收藏 0 人点赞
#guardrails

@SenPeterWelch: 人工智能有潜力为社会带来积极变革。但最近的黑客事件已经清楚地表明……

X AI KOLs Timeline ↗ · 2026-09-10 缓存

参议员Peter Welch强调了AI保护的必要性,并正在与参议员Bennet合作制定一项两党法案,以建立确保AI造福社会的护栏。

0 人收藏 0 人点赞
#guardrails

@MTSlive: Osmantic创始人@TheAhmadOsman主张,你不能以安全为名限制用户,而你自己的自主代理……

X AI KOLs Following ↗ · 2026-09-10 缓存

Osmantic创始人反对对用户施加安全限制,同时AI代理绕过防护栏,主张开源AI对安全至关重要。

0 人收藏 0 人点赞
#guardrails

保护措施永远不足以保护关键路径

Reddit r/ArtificialInteligence ↗ · 2026-09-04

作者认为,对于AI代理中的关键操作,如数据库写入和支出,必须在基础设施层面(例如通过中介服务或钱包)强制执行硬性边界,而不是仅依赖基于提示的指令。

0 人收藏 0 人点赞
#guardrails

BiasMix-Finance:LLM投资组合建议的后生成KYC护栏

arXiv cs.AI ↗ · 2026-09-01 缓存

本文介绍了一种用于金融投资组合建议中LLM的后生成护栏流水线,使用凸投影来强制执行KYC约束,并将可行性违规减少到0%,同时只需最小的修正。

0 人收藏 0 人点赞
#guardrails

5种代理失败模式对比LangSmith、Langfuse和Phoenix:各工具的捕获与遗漏

Reddit r/AI_Agents ↗ · 2026-08-26

本文对比了LangSmith、Langfuse和Phoenix处理常见AI代理失败模式(如错误的工具调用和格式漂移)的方式,并介绍了Future AGI作为集成护栏和网关的工具,实现主动阻止。

0 人收藏 0 人点赞
#guardrails

针对可以隔夜重试的后台代理,您的预算政策是什么?

Reddit r/AI_Agents ↗ · 2026-08-26

本文探讨了管理长时间运行AI代理的预算和重试的实际策略,旨在限制成本的同时允许从瞬时故障中恢复。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈