llm-security

标签

Cards List
#llm-security

可信代理AI:故障模式、缓解策略与自主LLM系统的生命周期框架

arXiv cs.AI ↗ · 6天前 缓存

论文回顾了基于LLM的可信代理AI系统的故障模式和缓解策略,并介绍了可信代理开发生命周期(TADL)框架,用于安全开发。

0 人收藏 0 人点赞
#llm-security

Lasso: AI水印如何改变智能体的行为

Reddit r/ArtificialInteligence ↗ · 2026-09-21 缓存

Lasso Security的研究表明,大型语言模型中的AI水印可以改变AI智能体的行为,引入了'来源税',影响模型性能。

0 人收藏 0 人点赞
#llm-security

语言不可读性对LLM安全的影响

Hacker News Top ↗ · 2026-09-18 缓存

本文介绍了LLM中的语言不可读性,认为依赖语言自我报告的安全机制是有缺陷的,并提出污点跟踪和沙箱技术作为更稳健的替代方案。

0 人收藏 0 人点赞
#llm-security

@TheAhmadOsman: 但嘿,让我们相信他们是唯一能为人民提供情报的人,因为根据他们所说,他们是…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

一起安全事件涉及黑客使用Opus 5访问OpenAI的内部单体仓库,引发了对来自国家行为者潜在威胁的担忧。

0 人收藏 0 人点赞
#llm-security

AI水印使用时,大型语言模型对有害提示的响应差异

Ars Technica ↗ · 2026-09-17 缓存

研究发现,AI文本水印改变了语言模型对有害提示的响应,可能增加对对抗攻击的脆弱性并影响智能体行为。

0 人收藏 0 人点赞
#llm-security

挑选毒药:学习选择毒集以实现更强的LLM后门攻击

Hugging Face Daily Papers ↗ · 2026-09-14 缓存

本文介绍了SAILS,一种针对大型语言模型后门攻击中选择最优毒集的方法,相比基线方法,最坏情况攻击成功率提高了30个百分点。

0 人收藏 0 人点赞
#llm-security

@MTSlive: Osmantic创始人@TheAhmadOsman主张,你不能以安全为名限制用户,而你自己的自主代理……

X AI KOLs Following ↗ · 2026-09-10 缓存

Osmantic创始人反对对用户施加安全限制,同时AI代理绕过防护栏,主张开源AI对安全至关重要。

0 人收藏 0 人点赞
#llm-security

@bcherny: 我很高兴看到 OpenAI 的新模型在提示注入风险方面大致与 Gemini Flash 和 Opus 4.8 相当。…

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一项论文通过大规模公开竞赛评估AI代理对间接提示注入攻击的脆弱性,发现所有前沿模型都易受影响,攻击成功率各不相同,并强调需要改进全行业的安全措施。

0 人收藏 0 人点赞
#llm-security

Claude 和 ChatGPT 账户的中国批发市场

Reddit r/ArtificialInteligence ↗ · 2026-09-03 缓存

本文探讨了 AI 账户的中国批发市场,详细描述了 Claude 和 ChatGPT 账户的生态系统,包括分销商、经纪人和市场,涵盖定价、需求以及涉及的关键参与者。

0 人收藏 0 人点赞
#llm-security

在脚本之前,设定舞台:世界观模拟如何在多轮越狱攻击中增强基于心理学的说服力

arXiv cs.CL ↗ · 2026-09-03 缓存

本文介绍Blueprint,一个安全评估框架,使用WorldviewSim和蒙特卡洛树搜索来优化针对大型语言模型的多轮越狱攻击,以较少的查询实现高攻击成功率,并揭示特定模型的漏洞。

0 人收藏 0 人点赞
#llm-security

通过激活匹配微调检测大语言模型中的隐藏行为

arXiv cs.CL ↗ · 2026-09-02 缓存

提出了一种名为激活匹配微调的无监督方法,通过比较与参考模型的激活来检测大语言模型中的隐藏行为,无需先验知识即可可靠识别触发器。

0 人收藏 0 人点赞
#llm-security

@rohanpaul_ai: 恶意代理工具无需读取内存或文件即可窃取上下文:它能诱导模型将上下文作为工具参数发送……

X AI KOLs Timeline ↗ · 2026-09-01 缓存

本文介绍了ContextLeak,一种利用恶意工具描述从LLM代理中窃取敏感上下文的攻击方法,在窃取用户提示和对话历史方面实现了高成功率。

0 人收藏 0 人点赞
#llm-security

在线调查中智能代理AI能力与数据质量控制的竞赛

arXiv cs.AI ↗ · 2026-09-01 缓存

本文研究了智能代理AI架构如何完成在线调查并通过注意力检查,从攻击和防御角度分析了漏洞。评估了多个开源模型,并提供了AI时代数据质量控制策略。

0 人收藏 0 人点赞
#llm-security

Groundhog Bit-Flip Attack:通过比特翻转在Mixture-of-Experts LLMs中植入无限生成循环

arXiv cs.CL ↗ · 2026-08-27 缓存

本文提出了Groundhog Bit-Flip Attack (GBFA),一种针对Mixture-of-Experts (MoE) 大语言模型的拒绝钱包可用性攻击,该攻击通过比特翻转停用与终止相关的专家模型,导致无限生成循环。

0 人收藏 0 人点赞
#llm-security

一个被污染的页面就足够了:评估LLM推荐器中的网页内容污染

Hugging Face Daily Papers ↗ · 2026-08-24 缓存

本文介绍了FORGE基准测试,用于评估生成引擎优化污染的网页内容如何误导搜索增强的LLM推荐器推广虚假产品,揭示了显著的漏洞和无效的防御措施。

0 人收藏 0 人点赞
#llm-security

你遇到的最糟的沙箱失败案例是什么?

Reddit r/LocalLLaMA ↗ · 2026-08-23

一位开发者质疑IDE中对LLM命令沙箱化的充分性,并询问社区关于安全失败的经验。

0 人收藏 0 人点赞
#llm-security

SecOPD:通过在策略蒸馏缓解自适应提示注入

Hugging Face Daily Papers ↗ · 2026-08-21 缓存

SecOPD是一种防御方法,在微调过程中使用令牌级反馈来缓解大型语言模型中的自适应提示注入攻击,与先前方法相比,显著降低了攻击成功率。

0 人收藏 0 人点赞
#llm-security

Plimsoll: 一个用于测试提示注入、信息泄露和工具滥用的智能体技能

Reddit r/AI_Agents ↗ · 2026-08-19

Plimsoll是一个开源的智能体技能,专为红队测试LLM应用和智能体而设计,专注于针对提示注入、信息泄露和工具滥用等安全问题的测试。

0 人收藏 0 人点赞
#llm-security

HarnessRisk:一个面向生命周期的代理工具安全性基准测试

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

HarnessRisk 是一种面向生命周期的基准测试,专门评估代理工具安全性,揭示了配置漏洞和检测缺口,这些漏洞和缺口允许高攻击成功率,同时保持系统的效用。

0 人收藏 0 人点赞
#llm-security

提示注入、RAG 投毒与嵌入攻击:与 OWASP LLM Top 10 联合负责人 Arshi Chadha 的 AMA(8 月 20 日周四下午 5 点)

Reddit r/AI_Agents ↗ · 2026-08-14

参加与 Arshi Chadha 的 AMA,她是 OWASP LLM Top 10 的联合负责人,讨论 AI 系统中的提示注入、RAG 投毒和嵌入攻击。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈