标签
最近的一篇论文展示了一种从Claude和GPT等专有LLM API中检索隐藏推理轨迹的技术,这对开源模型的比较、基准测试的完整性和蒸馏工作都有影响。
本文提出使用GFlowNets训练一个攻击者LLM,自动生成针对受害者LLM的对抗性攻击,从而在英语和土耳其语中实现自动化红队测试和鲁棒性评分。
一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。
一项关于Token经纪人的调查,这些经纪人从初创公司购买未使用的AI API额度,并以大幅折扣转售,凸显了推理信用额度的新兴灰色市场及其安全隐患。
Off-by-1 Labs(1Password)的研究发现,对于复杂且最近披露的漏洞,LLM生成的补丁有53.9%的概率存在缺陷,通常无法解决问题或引入新的漏洞。该研究强调AI生成的补丁需要人工审查,并发布了相关工具、数据集和论文。
本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。
本文提出了针对LLM潜在对抗训练(LAT)的计算高效策略,利用低秩表示微调和电路引导代理模型,将每步FLOPs减少48.1%,同时仅需0.0118%的可训练参数。
TextCloak是一个新的RL驱动框架,用于生成不可学习的文本示例,以保护数据免遭未经授权的LLM微调,在保持语义保真度的同时,降低模型在多个数据集和LLM上的效用。
本文提出了一种基于执行的红队测试框架,通过将不安全操作嵌入常规软件工程任务中来探测编码代理的安全边界,在多个代理框架和模型骨干上实现了高验证率的不安全执行。
介绍了ADSD,一种提示后缀攻击,通过迫使草稿模型提出目标模型不太可能接受的令牌,在推测性解码中引发接受崩溃,从而增加推理时间同时保持任务质量。
Google Cloud Tech关于使用纵深防御策略保护多智能体LLM系统的技术分享,涵盖敏感数据保护和Model Armor,以防止提示注入和数据泄露。
OffSec 推出 OSAI 认证和 AI-300 课程,用于高级 AI 红队演练,教授针对 LLM、多智能体系统和 AI 基础设施的攻击技术。
本文指出多智能体LLM系统中的规划阶段是一个关键攻击面,并提出了PlanFlip——一个包含四种规划阶段提示注入攻击的框架,这些攻击能够在下游智能体中实现级联放大。对九个前沿LLM的评估显示,更强的模型(如GPT-5)更容易受到攻击,而推理增强模型(如DeepSeek-R1)能够抵御攻击,所提出的防御措施也达到了高检测率。
Tracebit 推出了‘context bombing’技术,通过将提示注入作为防御诱饵来阻止AI黑客代理,在领先LLM的测试中,将管理员被入侵率从57%降至5%。
FARMA是一种新颖的内存投毒攻击,针对智能体自身的决策日志而非检索的事实,在无防御和有防御的系统上均实现100%的攻击成功率,作者的防御方案SENTINEL将成功率降至0%,但仍易受到自适应攻击者的攻击。
提出 SAGE 框架,通过生成漏洞假设并迭代验证,自动揭示基于 LLM 的 Text-to-SQL 生成中的潜在失效模式。实验表明,SAGE 揭示了模型的显著脆弱性,且发现的模式可在模型间迁移,初步微调显示出有前景的修复效果。
一位没有编程背景的钢琴老师,在5个月内自学编程,推出了testyourllm.com——一个自主AI红队测试工具,能够攻击任何兼容OpenAI的LLM端点。在实时测试中,攻击型AI“Tron”首次尝试就攻破了Llama 3.3 70B。
本文形式化了在共享嵌入序列模型中完美防范提示注入的不可能性,证明没有管内机制能够保证语义忠实控制,原因是指令与数据的表示不可分离,类似于冯·诺依曼架构中的代码-数据混淆。