llm-security

标签

Cards List
#llm-security

Claude与GPT的隐藏推理被解码,这很有趣

Reddit r/LocalLLaMA · 18小时前

最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。

0 人收藏 0 人点赞
#llm-security

使用GFlowNets为LLM生成攻击

arXiv cs.AI · 昨天 缓存

本文提出使用GFlowNets训练一个攻击者LLM,自动生成针对受害者LLM的对抗性攻击,从而在英语和土耳其语中实现自动化红队测试和鲁棒性评分。

0 人收藏 0 人点赞
#llm-security

窃取专有LLM API中的推理痕迹

Simon Willison's Blog · 昨天 缓存

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。

0 人收藏 0 人点赞
#llm-security

谁是Token经纪人?

Reddit r/artificial · 昨天 缓存

一项关于Token经纪人的调查,这些经纪人从初创公司购买未使用的AI API额度,并以大幅折扣转售,凸显了推理信用额度的新兴灰色市场及其安全隐患。

0 人收藏 0 人点赞
#llm-security

AI生成的安全漏洞补丁需要人工审查

Lobsters Hottest · 6天前 缓存

Off-by-1 Labs(1Password)的研究发现,对于复杂且最近披露的漏洞,LLM生成的补丁有53.9%的概率存在缺陷,通常无法解决问题或引入新的漏洞。该研究强调AI生成的补丁需要人工审查,并发布了相关工具、数据集和论文。

0 人收藏 0 人点赞
#llm-security

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#llm-security

通过低秩防御和电路引导代理的高效LLM对抗训练

arXiv cs.LG · 2026-08-03 缓存

本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。

0 人收藏 0 人点赞
#llm-security

TextCloak:以RL驱动的不可学习文本阻止未经授权的LLM利用

arXiv cs.CL · 2026-08-03 缓存

TextCloak是一个新的RL驱动框架,用于生成不可学习的文本示例,以保护数据免遭未经授权的LLM微调,在保持语义保真度的同时,降低模型在多个数据集和LLM上的效用。

0 人收藏 0 人点赞
#llm-security

软件工程流水线中编码代理的基于执行的安全测试

arXiv cs.AI · 2026-07-28 缓存

本文提出了一种基于执行的红队测试框架,通过将不安全操作嵌入常规软件工程任务中来探测编码代理的安全边界,在多个代理框架和模型骨干上实现了高验证率的不安全执行。

0 人收藏 0 人点赞
#llm-security

针对推测性解码中接受崩溃的对抗性提示

arXiv cs.CL · 2026-07-27 缓存

介绍了ADSD,一种提示后缀攻击,通过迫使草稿模型提出目标模型不太可能接受的令牌,在推测性解码中引发接受崩溃,从而增加推理时间同时保持任务质量。

0 人收藏 0 人点赞
#llm-security

@GoogleCloudTech: LLM的工作是推理,而非安全。仅仅依赖内置的模型护栏会让你暴露在高级攻击之下…

X AI KOLs Timeline · 2026-07-25 缓存

Google Cloud Tech关于使用纵深防御策略保护多智能体LLM系统的技术分享,涵盖敏感数据保护和Model Armor,以防止提示注入和数据泄露。

0 人收藏 0 人点赞
#llm-security

@offsectraining: OSCP 奠定了基础。OSAI 是进化的召唤 如果你已经获得了 OSCP,你已经知道如何像攻击者一样思考…

X AI KOLs Timeline · 2026-07-24 缓存

OffSec 推出 OSAI 认证和 AI-300 课程,用于高级 AI 红队演练,教授针对 LLM、多智能体系统和 AI 基础设施的攻击技术。

0 人收藏 0 人点赞
#llm-security

PlanFlip:通过规划阶段提示注入攻击多智能体LLM系统

arXiv cs.AI · 2026-07-21 缓存

本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。

0 人收藏 0 人点赞
#llm-security

如今,防御者也开始采用提示注入

Ars Technica · 2026-07-13 缓存

Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。

0 人收藏 0 人点赞
#llm-security

FARMA:一种伪造智能体自身决策日志而非检索事实的内存投毒攻击

Reddit r/AI_Agents · 2026-07-11

FARMA是一种新颖的内存投毒攻击,针对智能体自身的决策日志而非检索的事实,在无防御和有防御的系统上均实现100%的攻击成功率,作者的防御方案SENTINEL将成功率降至0%,但仍易受到自适应攻击者的攻击。

0 人收藏 0 人点赞
#llm-security

超越静态规则:Text-to-SQL 中潜在漏洞的自动发现

arXiv cs.CL · 2026-07-07 缓存

提出 SAGE 框架,通过生成漏洞假设并迭代验证,自动揭示基于 LLM 的 Text-to-SQL 生成中的潜在失效模式。实验表明,SAGE 揭示了模型的显著脆弱性,且发现的模式可在模型间迁移,初步微调显示出有前景的修复效果。

0 人收藏 0 人点赞
#llm-security

想要AI代理不泄露秘密?那就不要给它们秘密

Reddit r/ArtificialInteligence · 2026-07-01

关于一篇文章的简短公告,讨论将秘密远离LLM以防止AI代理泄露的原则。

0 人收藏 0 人点赞
#llm-security

5个月前我自学编程,打造了一款自主AI红队测试工具——testyourllm.com

Reddit r/artificial · 2026-06-30

一位没有编程背景的钢琴老师,在5个月内自学编程,推出了testyourllm.com——一个自主AI红队测试工具,能够攻击任何兼容OpenAI的LLM端点。在实时测试中,攻击型AI“Tron”首次尝试就攻破了Llama 3.3 70B。

0 人收藏 0 人点赞
#llm-security

是否可能存在带有后门的恶意LLM

Reddit r/LocalLLaMA · 2026-06-29

讨论了包含由秘密句子或条件触发的后门的LLM的可能性,以及闭源与开源模型的相对风险。

0 人收藏 0 人点赞
#llm-security

论共享嵌入序列模型中指令与数据的不可分离性

arXiv cs.AI · 2026-06-29 缓存

本文形式化了在共享嵌入序列模型中完美防范提示注入的不可能性,证明没有管内机制能够保证语义忠实控制,原因是指令与数据的表示不可分离,类似于冯·诺依曼架构中的代码-数据混淆。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈