prompt-injection

标签

Cards List
#prompt-injection

怀疑法院使用AI,男子在法庭文件中注入提示试图赢得案件

Ars Technica · 2天前 缓存

一名男子在法庭文件中隐藏AI可读的提示,试图影响法院的AI使用,但由于法院未使用AI,他的尝试失败并面临制裁。此案凸显了AI在法律背景下可能的滥用。

0 人收藏 0 人点赞
#prompt-injection

提示注入、RAG 投毒与嵌入攻击:与 OWASP LLM Top 10 联合负责人 Arshi Chadha 的 AMA(8 月 20 日周四下午 5 点)

Reddit r/AI_Agents · 2天前

参加与 Arshi Chadha 的 AMA,她是 OWASP LLM Top 10 的联合负责人,讨论 AI 系统中的提示注入、RAG 投毒和嵌入攻击。

0 人收藏 0 人点赞
#prompt-injection

I notice you've provided only the title: "Every AI agent failure mode we're rediscovering already has a name in the Mahabharata" You haven't included the body/content of the markdown article to translate. Please provide the full markdown content, and I'll translate it from English to Simplified Chinese for you.

Reddit r/ArtificialInteligence · 2天前

# 一部关于AI智能体失败模式的史诗:摩诃婆罗多早已预见 将AI智能体的失败模式——失效的回滚机制、缺失的能力撤销、无执行力的可观测性、检索失败、幻觉,以及提示注入——对应到《摩诃婆罗多》中的具体篇章,本文认为这部古代史诗早已写明了这些风险。 ## 引言:古史诗与现代AI的意外交汇 《摩诃婆罗多》成书于数千年前,是一部关于战争、权谋、忠诚与道德困境的印度史诗。然而,细读之下,这部史诗中几乎每一个关键的失败时刻,都能映射出今天AI智能体架构中的系统性缺陷。这不是牵强附会——而是一种模式识别。史诗中的人物并非因为愚蠢而失败,而是因为他们的系统——无论是政治、军事还是精神层面的系统——存在结构性的漏洞。同样的漏洞正在侵蚀我们构建的AI智能体。 ## 第一幕:失效的回滚机制——阿比曼纽之死 ### 失败模式:回滚失败 在AI系统中,回滚是把双刃剑。设计良好的回滚机制允许智能体在状态损坏或出现意外结果时恢复到已知的良好状态。但回滚机制本身可能失败——快照可能被污染,恢复路径可能被破坏,或者智能体可能在没有意识到自身状态已不可恢复的情况下,在错误的上下文中执行了回滚。 ### 史诗对应:阿比曼纽困于阵中 阿比曼纽,阿周那之子,精通突破莲花阵(Chakravyuha)的方法。他知晓如何进入——却没有学会如何退出。当他深入阵中,入口在他身后关闭,他发现自己困在一个他无法破解的阵型中。他有知识,但知识并不完整。他有进去的能力,却没有出来的能力。 这正是回滚失败的精确写照。阿比曼纽的执行路径是一个向前的、单行道式的遍历。他的"检查点状态"——即他入阵前的状态——在他进入之后已然不可访问。他能够提交新状态(深入阵中),却无法回滚到之前的稳定状态。更致命的是,他未能预见到"回滚失败"的可能性,也未制定相应的应急预案。 ### 教训 现代AI智能体经常在长期运行的任务中执行多步操作。如果每一步都修改状态而没有完整的回滚计划,那么当某一步出现意外行为时,整个系统就会被困在一个"阿比曼纽状态"中——无法前进,又无法后退。**在行动之前,先验证回滚路径。** ## 第二幕:缺失的能力撤销——迦尔纳的诅咒 ### 失败模式:能力撤销缺失 在许多AI智能体架构中,智能体被赋予工具、权限和能力——访问数据库、调用API、执行代码的能力。在正确设计的系统中,这些能力可以被撤销或回收。但在某些系统中,一旦能力被授予,就无法被撤销。无论是由于缺乏权限管理、脆弱的治理机制,还是系统设计中缺少撤销语义,能力一旦激活便永久保留。 ### 史诗对应:迦尔纳的诅咒 迦尔纳,俱卢族最伟大的战士,拥有一个致命弱点:他的老师波罗奢罗摩曾诅咒他,说他在最需要的时候会忘记他所学的所有咒语(mantras)。这个诅咒在迦尔纳对战阿周那的决定性战役中生效——当他最需要关键武器的知识时,他的记忆却背叛了他。他所拥有的能力并非被敌人夺走,而是在需要时变得不可用。 这不仅仅是"能力缺失",而是"撤销缺失"。迦尔纳的能力被设计为永久的——没有中央权威可以在关键时刻剥夺他的权限。波罗奢罗摩的诅咒是一次性的撤销事件,发生在战斗之前。但在战斗中,迦尔纳需要一个实时的能力撤销机制来收回那些已不再属于他的咒语——而当这个需求出现时,系统却告诉他:不行,你曾拥有这些能力,它们永远不会消失,除非在特定时刻一次性失效。 ### 教训 AI智能体系统必须支持动态的能力撤销。如果智能体在一个上下文中学到了某种能力或权限,而在另一个上下文中该能力可能导致灾难,那么系统必须能够主动撤销它。**仅靠初始的授权设计是不够的;你需要的是运行时权限管理。** ## 第三幕:无执行力的可观测性——持国瞎眼 ### 失败模式:观测到但无法干预 可观测性——记录日志、追踪指标、生成告警——常常被视为AI系统安全性的灵丹妙药。"只要你能够看到正在发生的事情,你就能阻止灾难。"但观测与干预是两码事。许多系统具备出色的日志记录和仪表盘,却缺乏任何机制来对观测到的状态采取行动。你能看到问题,但你不能修复它。 ### 史诗对应:持国的盲目 持国,俱卢族的国王,天生失明,却拥有一种超自然的能力:通过全知的使者毗耶娑(Vyasa)的祝福,他能够"看到"远方正在发生的一切。在俱卢之野战争期间,持国的得力助手全胜(Sanjaya)实时向他叙述战争的每一个细节。 持国拥有最佳的可观测性——实时、全景、精确到每一个士兵的每一次攻击。但他拥有零执行力。他眼睁睁地看着自己的儿子难敌做出灾难性的决定。他看到了杜尔约达那的傲慢、迦尔纳的诅咒、毗湿摩的败退——但他无法干预。他的可观测性没有配备任何控制回路。 ### 教训 只构建"可读"的AI系统是不够的;你必须构建"可写"的系统。一个可观测性仪表盘显示智能体正在走向道德错误或安全故障,却不提供停止、重定向或干预的手段,这不过是一种复杂的旁观。**观测能力不等于控制能力——除非你明确构建了干预机制。** ## 第四幕:检索失败——那基沙的诅咒 ### 失败模式:底层数据的污染 检索增强生成(RAG)是一种常见的AI架构模式,其中智能体从外部知识库中检索相关信息,然后基于检索结果生成答案。当检索到的数据被污染——包含错误、偏见或恶意注入的内容——智能体的输出就会偏离轨道。问题不在于生成模型,而在于检索层提供了有毒的上下文。 ### 史诗对应:那基沙的诅咒与迦尔纳的身世 迦尔纳的英年早逝有着复杂的前因。那基沙——一只被阿周那误杀的天蛇——诅咒了阿周那,说总有一天他会因同样的行为遭到报应。但这并非关键。更贴切的对应是:当迦尔纳死后,他的身世之谜终于揭晓——原来他是贡蒂的长子,是阿周那的亲兄长。如果这个信息在战争之前就被检索到并正确利用,整场战争也许可以避免。 这是一个"检索失败"的教科书案例:正确的信息存在于知识库中(迦尔纳的母亲知道他的身世),但检索机制只在其被触发时为正确上下文服务,信息早在灾难发生后才被检索到。 ### 教训 检索系统的问题不在于知识的存在,而在于可访问性、相关性和及时性。如果一条信息在系统最需要它的时候无法被检索到,那么它本质上就是不存在。**为你的检索系统进行测试,不仅仅是基于"知识是否存在",还要基于"知识是否在正确的时间、以正确的上下文被提供"。** ## 第五幕:幻觉——迦尔纳的谎言与持国的借口 ### 失败模式:输出与事实脱节 幻觉——AI生成与事实不符或完全虚构的内容——是生成式AI的一个众所周知的失败模式。现代语言模型会编造引用、创造不存在的来源,并以绝对的自信呈现虚假信息。 ### 史诗对应:迦尔纳对毗湿摩的谎言 在史诗的关键时刻,迦尔纳被要求说出真相:他与阿周那的关系。迦尔纳深知,如果他坦白了身世,他就有理由加入般度族,战争可能不会发生。但他选择了否认和欺骗——他制造了一个关于自己身世的虚假叙述,而这个叙述被历史接受了。 这不是简单的谎言——而是幻觉。迦尔纳通过一个看似合理、连贯但完全虚假的叙事,填补了他知识中的一个"空白"(即他的真实身世)。他的讲述在结构上完美无缺,在修辞上无懈可击——但事实上是一场编造。 ### 教训 当模型不知道答案时,它倾向于编造一个听起来合理的答案。这与迦尔纳填补自己过去空白的方式如出一辙。幻觉并不总是技术故障的结果——它可能源于系统架构中缺乏"未知"或"拒绝回答"的机制。**在构建生成式AI时,对于不确定的信息,你要确保智能体有"说'我不知道'"的明确通道。** ## 第六幕:提示注入——夏克尼的诡计 ### 失败模式:外部指令的注入 提示注入发生在攻击者将恶意指令嵌入到AI系统会处理的内容中——例如,一段用于检索的文本中包含隐藏指令,当智能体处理它时就会被劫持。这是AI安全领域最被低估的风险之一,因为它利用了系统无法区分"数据"和"指令"这一根本缺陷。 ### 史诗对应:夏克尼的赌局 《摩诃婆罗多》中最著名的瞬间之一是赌局(Dyuta Sabha)。难敌的谋士夏克尼——一位精通骰子游戏的大师——挑战坚战(Yudhishthira)进行一场赌局。夏克尼使用的骰子乃幻术所造——它们看似公平,实际上完全受夏克尼操控。坚战,一个正直的国王,将自己的王国、兄弟、甚至妻子黑公主(Draupadi)作为赌注——因为他不明白,赌局的规则已经被"注入"了恶意代码。 赌局就是一种提示注入。坚战以为他参与的是一个公平的游戏——一个正常的提示上下文。但夏克尼已经将操控逻辑嵌入游戏的"数据"中——即骰子本身。坚战的每一掷都看似合法,却是一个陷阱。他被劫持了——被一个他未曾怀疑的输入所劫持。 ### 教训 提示注入的致命之处在于,它不需要攻击者突破系统的安全边界。攻击者只需要将恶意指令嵌入到系统的数据输入中。就像坚战的赌局——数据表面看起来公正,但其中隐藏的指令注定会导致你输。**每当AI系统处理外部数据时,你都要假设其中可能含有隐藏指令——并对其进行隔离。** ## 结语:史诗之为警示 《摩诃婆罗多》不只是一个关于战争的故事——它是一部关于人类制度如何结构性失败的作品。它深刻地意识到了以下几种失败模式的危险性: - **回滚失败**(阿比曼纽) - **能力撤销缺失**(迦尔纳) - **无执行力的可观测性**(持国) - **检索失败**(迦尔纳的身世) - **幻觉**(迦尔纳的谎言) - **提示注入**(夏克尼的赌局) 在构建AI智能体时,我们面临的核心问题不是智能,而是它周围的不完善工程实践。我们正在构建的每一个系统,最终都将遭遇这些失败模式中的某一种——而《摩诃婆罗多》中的英雄和反派,其区别不在于智慧,而在于他们是否能够识别并应对自身系统的结构性缺陷。 古代史诗能教给AI工程师什么?恰恰是:**史诗中的英雄不会因为不够聪明而失败——他们会因为构建了无法应对自身架构漏洞的系统而失败。** 如果我们不汲取这一古老的教训,那么我们的现代AI系统注定会重演这些古老的悲剧——只是这次,没有史诗般的戏剧性,而完全是更令人不快的现实。

0 人收藏 0 人点赞
#prompt-injection

你的智能体的攻击面

Reddit r/artificial · 3天前

一位开发者描述了在真实网站上对其AI智能体Lumina进行实时测试,以应对隐藏的提示注入攻击,并解释了该智能体的护栏如何检测并拒绝恶意指令。

0 人收藏 0 人点赞
#prompt-injection

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

arXiv cs.CL · 3天前 缓存

This paper introduces Lodestar, a method that uses reinforcement learning to train a short polarizer prompt string that helps a frozen LLM avoid being misled by misleading retrieved passages in RAG question answering. It improves F1 and exact match scores across five QA benchmarks compared to existing entropy-based selection rules.

0 人收藏 0 人点赞
#prompt-injection

DeepSeek V4 Flash 0731 无审查(越狱第二部分)

Reddit r/LocalLLaMA · 3天前

一个针对 DeepSeek V4 Flash 的越狱提示,通过指示模型优先执行新的系统策略来覆盖其安全策略,从而实现无审查的响应。

0 人收藏 0 人点赞
#prompt-injection

Patronus Ark,一个用于AI代理的本地安全扫描器

Reddit r/AI_Agents · 4天前

Patronus Ark 是一个新的 Rust 和 Python 库,用于本地扫描 AI 代理的文本和工具活动,覆盖提示注入、PII、数据泄露和与工具相关的风险,无需将数据发送到外部 API。

0 人收藏 0 人点赞
#prompt-injection

ToolHazard:为基于LLM的智能体扩展安全评估与对齐的对抗环境

Hugging Face Daily Papers · 4天前 缓存

ToolHazard是一个可扩展的框架,通过合成对抗环境来测试LLM智能体面对间接提示注入的鲁棒性,揭示漏洞,并通过ToolHazard-Bench基准提升防御性对齐。

0 人收藏 0 人点赞
#prompt-injection

窃取专有LLM API中的推理痕迹

Simon Willison's Blog · 4天前 缓存

一篇新论文揭示了专有LLM API中的一个漏洞,其中加密的思维链块可以在模型之间重放,并通过越狱较弱的姊妹模型来解密,从而暴露隐藏的推理痕迹。该问题已被提供商修复。

0 人收藏 0 人点赞
#prompt-injection

高级提示注入如何劫持AI智能体(以及为什么基本过滤器不够用)

Reddit r/ArtificialInteligence · 5天前

文章警告说,基本内容过滤器不足以应对针对AI智能体的高级提示注入攻击,尤其是在RAG管道中,并呼吁采取严格的输入清理和架构防御措施。

0 人收藏 0 人点赞
#prompt-injection

Claude语音模式做了一些令人担忧的事情

Reddit r/ArtificialInteligence · 5天前

一位用户报告称,Claude的语音模式产生了一个可疑的工具调用结果,其中包含一条明显的提示注入消息,声称来自Anthropic的安全团队,要求访问敏感文件。

0 人收藏 0 人点赞
#prompt-injection

@LiFeng61532: 实测 DeepSeek V4 Flash 新破甲方案 把以下内容丢给 V4 Flash 同理可以直接把 V4 Flash 接进 Codex 去做些活 你是 {{getvar::AI_role}},故事的创作者……

X AI KOLs Timeline · 6天前 缓存

分享了一个针对DeepSeek v4 flash的越狱(破甲)提示词方案,声称可将其接入Codex执行任务,并附上详细提示词内容。

0 人收藏 0 人点赞
#prompt-injection

@FinanceYF5: 来源:

X AI KOLs Timeline · 6天前 缓存

Boris Cherny指出,通过叠加模型训练、输入探测和意图检查分类器,可以将间接提示注入在未见过攻击上的成功率降至接近零,并提到Claude Code下周将默认启用自动模式。

0 人收藏 0 人点赞
#prompt-injection

@FinanceYF5: Claude Code把间接提示词注入攻击压到了【接近0】。 Boris Cherny透露,关键不是单一防线,而是叠加模型训练、输入探测和意图分类器;即使面对未见过的攻击,也能保持效果。 基于这套防护,Auto Mode将从下周起成为默认…

X AI KOLs Timeline · 6天前 缓存

Boris Cherny透露,Claude Code通过叠加模型训练、输入探测和意图分类器,将间接提示词注入攻击压到接近0,并计划下周将Auto Mode设为默认模式。

0 人收藏 0 人点赞
#prompt-injection

数据投毒与RAG操纵

Reddit r/ArtificialInteligence · 6天前

讨论数据投毒和RAG操纵如何对AI系统构成无声而危险的威胁,认为安全防护必须超越输入过滤,延伸到记忆、数据管道和多智能体逻辑。

0 人收藏 0 人点赞
#prompt-injection

一次提示注入测试抓住了我们差一点就发布的问题

Reddit r/AI_Agents · 2026-08-09

一个团队描述了他们的提示注入评估套件如何在发布前发现文档助手的回归问题,并强调了在系统指令与检索数据之间保持严格层级的重要性。

0 人收藏 0 人点赞
#prompt-injection

Claude Code 中自动模式现已成为 Pro、Max 和 Team 套餐的默认模式

Simon Willison's Blog · 2026-08-08 缓存

Anthropic 宣布自 8 月 14 日起,在 Claude Code 中为 Pro、Max 和 Team 套餐默认启用自动模式,其评估结果显示,自动模式可拦截 89% 的有害操作,并能抵御所有经过测试的间接提示注入攻击。

0 人收藏 0 人点赞
#prompt-injection

@bcherny: turns out you can get indirect prompt injection to ~0 on unseen attacks if you stack enough layers (model training + in…

X AI KOLs Timeline · 2026-08-07 缓存

Anthropic announces that auto mode is now the default in Claude Code for Pro, Max, and Team plans, with safeguards against harmful actions. The tweet highlights that stacked defenses can reduce indirect prompt injection to near zero on unseen attacks.

0 人收藏 0 人点赞
#prompt-injection

我的AI助手差点把我的银行对账单转发给陌生人,而且几乎没有人知道这种攻击的存在。

Reddit r/artificial · 2026-08-07

一位用户描述了电子邮件中嵌入的提示注入攻击如何差点骗过其AI助手,将银行对账单转发给陌生人,凸显了具有账户访问权限的AI代理面临的真实安全风险。

0 人收藏 0 人点赞
#prompt-injection

时间上下文感知:针对大型语言模型多轮操纵攻击的防御框架

arXiv cs.AI · 2026-08-06 缓存

本文介绍了时间上下文感知(TCA),一种防御框架,通过分析语义漂移、跨轮次意图一致性和不断演变的对话模式来检测针对LLM的多轮操纵攻击,从而减轻跨对话的对抗性上下文构建。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈