defenses

标签

Cards List
#defenses

当智能体学会成为你:人格技能中的隐私泄露、模仿风险与防御基准测试

Hugging Face Daily Papers · 2026-08-04 缓存

介绍了AntiSkillBench,一个用于评估AI智能体人格技能管线中隐私泄露、模仿风险及防御措施的基准,发现风险在不同主干模型上持续存在,且现有防御措施效果有限。

0 人收藏 0 人点赞
#defenses

自托管AI代理的自身状态攻击:操作系统防御能走多远?

Hugging Face Daily Papers · 2026-07-20 缓存

本文研究了操作系统针对自托管AI代理的自身状态攻击的韧性,描述了一个攻击空间并评估了分层防御策略。研究发现,尽管分层防御栈是有效的,但仍存在一个小的残余攻击面,在操作系统层面结构上难以区分。

0 人收藏 0 人点赞
#defenses

你们如何处理读取外部内容的代理中的提示注入问题?

Reddit r/AI_Agents · 2026-07-04

关于在读取外部内容(如电子邮件和网页)的AI代理中处理提示注入攻击的讨论,探讨了生产级别的防御措施以及超越明显模式的微妙威胁。

0 人收藏 0 人点赞
#defenses

@MaxForAI: 黑客Vitto Rivabella公开宣布Fable 5又被攻破了 他表示大部分的越狱尝试都失败了,防护显然是分层的。 该模型受到极度严密的保护(当然它会拦截 90%的请求,但他们确实做得很好)。 该模型似乎同时在输入端和输出端进行安全检…

X AI KOLs Timeline · 2026-07-03 缓存

黑客Vitto Rivabella公开宣布成功越狱Fable 5,详细分析了模型的多层安全防护机制,包括输入输出审核、意图检测和链式思维防御,并给出了绕过方法。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈