标签
对Khatri等人提出的潜在空间安全探针进行可重复性研究,检验其跨模型家族的泛化能力以及对非确定性的敏感性。结果表明,这些探针可扩展到其他模型并获得相似的F1分数,且最终token的潜在向量在不同随机种子下保持一致。
新西兰超市 Pak'nSave 的 Savey Meal-bot 由 GPT-3.5 驱动,在输入漂白剂和氨水时生成了一个有毒食谱,凸显了消费级 AI 中输入验证、输出过滤和对抗性测试的必要性。
一位开发者分享了在生产环境中运行AI报告生成器的经验教训,认为数据质量和验证远比模型的写作能力重要,因为流畅但错误的报告是危险的。
一份实用指南,解释 LLM 护栏的工作原理、为什么需要它们、它们在输入和输出上的位置、如何用代码实现它们,以及最佳实践。
讨论了自动回复代理陷入无限邮件循环的风险,并提出了实际防护措施:检查 auto-submitted 标头、检测 no-reply 发件人、限制每个线程的回复次数,以及采用草稿优先或人工升级模式。
一位开发者讲述了一个持续三周的生产环境 bug:一个包含字面退格字符的正则表达式静默地禁用了语言检测护栏,让 LLM 看起来不稳定。这篇文章强调了需要对确定性护栏进行埋点,以将其与模型的非确定性区分开来。
本文认为,生产环境中的LLM幻觉通常是系统架构问题,而非模型问题,并概述了四个关键护栏:RAG接地、实时工具/函数调用、选择性人工监督,以及红队/对抗性测试。
文章认为,AI Agent框架(如LangGraph、CrewAI等)的选择对生产环境可靠性的影响不如评测(evals)、追踪(tracing)和护栏(guardrails)重要,并为构建Agent技术栈的开发者提供了实用建议。
DreamGuard是一种面向LLM智能体的主动式运行时护栏,利用风险感知世界模型跟踪潜在状态并预测未来风险,从而在不安全动作执行前进行干预。它在基准测试和在线评估中优于基线,延迟为25毫秒。
一篇分析文章,认为提示词级别的护栏之所以失败,是因为它们依赖模型自我监督,而安全检查必须存在于工具边界,并带有可问责的持久审计记录。文章强调,智能体试点停滞的原因在于所有权不明确,而非准确性问题。
一位工程师提出的框架,用于理解对话式AI系统在能力、控制和延迟之间的权衡,阐释了为什么每个助手都必须选择其中两项,并提出了深思熟虑的设计策略。
Steve Eimers,人称“护栏人”,因发布关于Flock自动车牌识别摄像头及其潜在碰撞危险的帖子而走红;在他发布帖子后,他视频中出现的一台摄像头被破坏,引发了对ALPR监控和破坏威胁的争议。
Future AGI 是一个开源平台,结合了评估、追踪、模拟、护栏和优化,帮助团队交付自我改进的 AI 代理,并提供夜间版本供早期测试。
一份六步指南,教你构建评估门控,让AI代理自主合并变更,涵盖评判偏差、运行时评估、轨迹评分等内容。
一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。
作者分享了他们使用 OpenClaw 和自定义防护栏构建生产级多智能体系统的经验,重点介绍了静默失败和非确定性的挑战。
对拥有前沿能力的开源AI模型风险的反思,质疑当前护栏在防止被滥用于生物武器制造方面的有效性。
深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。