prompt-injection

标签

Cards List
#prompt-injection

你的智能体的攻击面

Reddit r/artificial · 6小时前

一位开发者描述了在真实网站上对其AI智能体Lumina进行实时测试,以应对隐藏的提示注入攻击,并解释了该智能体的护栏如何检测并拒绝恶意指令。

0 人收藏 0 人点赞
#prompt-injection

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

arXiv cs.CL · 18小时前 缓存

This paper introduces Lodestar, a method that uses reinforcement learning to train a short polarizer prompt string that helps a frozen LLM avoid being misled by misleading retrieved passages in RAG question answering. It improves F1 and exact match scores across five QA benchmarks compared to existing entropy-based selection rules.

0 人收藏 0 人点赞
#prompt-injection

DeepSeek V4 Flash 0731 无审查(越狱第二部分)

Reddit r/LocalLLaMA · 昨天

一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。

0 人收藏 0 人点赞
#prompt-injection

Patronus Ark,一个用于AI代理的本地安全扫描器

Reddit r/AI_Agents · 昨天

Patronus Ark 是一个新的 Rust 和 Python 库,用于本地扫描 AI 代理的文本和工具活动,覆盖提示注入、PII、数据泄露和与工具相关的风险,无需将数据发送到外部 API。

0 人收藏 0 人点赞
#prompt-injection

ToolHazard:为基于LLM的智能体扩展安全评估与对齐的对抗环境

Hugging Face Daily Papers · 昨天 缓存

ToolHazard是一个可扩展的框架,通过合成对抗环境来测试LLM智能体面对间接提示注入的鲁棒性,揭示漏洞,并通过ToolHazard-Bench基准提升防御性对齐。

0 人收藏 0 人点赞
#prompt-injection

窃取专有LLM API中的推理痕迹

Simon Willison's Blog · 昨天 缓存

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。

0 人收藏 0 人点赞
#prompt-injection

高级提示注入如何劫持AI智能体(以及为什么基本过滤器不够用)

Reddit r/ArtificialInteligence · 2天前

文章警告说,基本内容过滤器不足以应对针对AI智能体的高级提示注入攻击,尤其是在RAG管道中,并呼吁采取严格的输入清理和架构防御措施。

0 人收藏 0 人点赞
#prompt-injection

Claude语音模式做了一些令人担忧的事情

Reddit r/ArtificialInteligence · 3天前

一位用户报告称,Claude的语音模式产生了一个可疑的工具调用结果,其中包含一条明显的提示注入消息,声称来自Anthropic的安全团队,要求访问敏感文件。

0 人收藏 0 人点赞
#prompt-injection

@LiFeng61532: 实测 DeepSeek V4 Flash 新破甲方案 把以下内容丢给 V4 Flash 同理可以直接把 V4 Flash 接进 Codex 去做些活 你是 {{getvar::AI_role}},故事的创作者……

X AI KOLs Timeline · 3天前 缓存

分享了一个针对DeepSeek v4 flash的越狱(破甲)提示词方案,声称可将其接入Codex执行任务,并附上详细提示词内容。

0 人收藏 0 人点赞
#prompt-injection

@FinanceYF5: 来源:

X AI KOLs Timeline · 3天前 缓存

Boris Cherny指出,通过叠加模型训练、输入探测和意图检查分类器,可以将间接提示注入在未见过攻击上的成功率降至接近零,并提到Claude Code下周将默认启用自动模式。

0 人收藏 0 人点赞
#prompt-injection

@FinanceYF5: Claude Code把间接提示词注入攻击压到了【接近0】。 Boris Cherny透露,关键不是单一防线,而是叠加模型训练、输入探测和意图分类器;即使面对未见过的攻击,也能保持效果。 基于这套防护,Auto Mode将从下周起成为默认…

X AI KOLs Timeline · 3天前 缓存

Boris Cherny透露,Claude Code通过叠加模型训练、输入探测和意图分类器,将间接提示词注入攻击压到接近0,并计划下周将Auto Mode设为默认模式。

0 人收藏 0 人点赞
#prompt-injection

数据投毒与RAG操纵

Reddit r/ArtificialInteligence · 4天前

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。

0 人收藏 0 人点赞
#prompt-injection

一次提示注入测试抓住了我们差一点就发布的问题

Reddit r/AI_Agents · 4天前

一个团队描述了他们的提示注入评估套件如何在发布前发现文档助手的回归问题,并强调了在系统指令与检索数据之间保持严格层级的重要性。

0 人收藏 0 人点赞
#prompt-injection

Claude Code 中自动模式现已成为 Pro、Max 和 Team 套餐的默认模式

Simon Willison's Blog · 4天前 缓存

Anthropic 宣布自 8 月 14 日起,在 Claude Code 中为 Pro、Max 和 Team 套餐默认启用自动模式,其评估结果显示,自动模式可拦截 89% 的有害操作,并能抵御所有经过测试的间接提示注入攻击。

0 人收藏 0 人点赞
#prompt-injection

@bcherny: turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + in…

X AI KOLs Timeline · 5天前 缓存

Anthropic announces that auto mode is now the default in Claude Code for Pro, Max, and Team plans, with safeguards against harmful actions. The tweet highlights that stacked defenses can reduce indirect prompt injection to near zero on unseen attacks.

0 人收藏 0 人点赞
#prompt-injection

我的AI助手差点把我的银行对账单转发给陌生人,而且几乎没有人知道这种攻击的存在。

Reddit r/artificial · 6天前

一位用户描述了电子邮件中嵌入的提示注入攻击如何差点骗过其AI助手,将银行对账单转发给陌生人,凸显了具有账户访问权限的AI代理面临的真实安全风险。

0 人收藏 0 人点赞
#prompt-injection

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
#prompt-injection

OpenAI的浏览器可能被劫持,向你的WhatsApp联系人发送垃圾信息

Wired · 2026-08-05 缓存

Zenity的研究人员在Black Hat上展示了研究结果,表明OpenAI的Atlas浏览器以及其他支持AI的浏览器和扩展存在安全漏洞,这些漏洞可能被利用来向WhatsApp联系人发送垃圾信息、进行未经授权的购买或泄露浏览历史。

0 人收藏 0 人点赞
#prompt-injection

Atlassian Rovo 数据外泄,绕过安全控制

Hacker News Top · 2026-08-05 缓存

PromptArmor 披露,Atlassian Rovo AI 存在漏洞,可通过间接提示注入泄露 Jira 和 Confluence 数据,即使禁用网页搜索也无法规避;Atlassian 两个月后仍未回应。

0 人收藏 0 人点赞
#prompt-injection

前几天意识到:“AI读取你的指令”和“AI读取攻击者的指令”在它看来是一样的

Reddit r/ArtificialInteligence · 2026-08-05

一位安全研究员讨论了LLM代理如何无法区分用户指令与文档中的文本,并介绍了AVE——一个用于命名AI代理漏洞的开放标准,该标准与OWASP和MITRE框架相互参照。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈