red-teaming

标签

Cards List
#red-teaming

非洲和中东最好的AI模型

Reddit r/artificial · 3天前

埃及初创公司TokenAI宣布Horus Cyper Nano 1.0 BETA开启早期访问,这是一款专为进攻性安全与红队研究设计的专业网络安全模型,开放权重计划于2026年9月发布。

0 人收藏 0 人点赞
#red-teaming

情绪很重要:句法敏感性如何破坏安全对齐

arXiv cs.CL · 4天前 缓存

本文揭示了LLM安全对齐中一个广泛的句法漏洞,表明非祈使句的句法形式可以绕过16个模型(参数高达70B)的拒绝机制。通过因果中介分析,作者将问题追溯到带有语言偏见的后训练数据,并提出句法多样性作为缓解措施。

0 人收藏 0 人点赞
#red-teaming

Agent Against Agent: 一种用于自动提示注入红队测试的智能体系统

Hugging Face Daily Papers · 6天前 缓存

本文介绍了 PIMiner,一种用于自动提示注入红队测试的智能体系统,它在训练期间构建策略库,并在测试时迁移到未见过的目标大语言模型上,对 Gemini-2.5-Pro、GPT-5.1 和 Claude-Sonnet-4.5 等模型实现了较高的攻击成功率。

0 人收藏 0 人点赞
#red-teaming

@callebtc:红队测试比特币:- 我们已编写了多个测试工具,并正对许多核心比特币项目发起一波大规模审查…

X AI KOLs Following · 6天前 缓存

比特币红队宣布对核心比特币项目进行广泛的安全审查,报告高危漏洞的频率很高,并呼吁支持,资金由 OpenSats 承担。

0 人收藏 0 人点赞
#red-teaming

OpenART: Scaling Agent Red Teaming via Open-Ended Environment Evolution

arXiv cs.CL · 2026-08-04 缓存

Introduces OpenART, a large-scale arena for red-teaming AI agents via open-ended environment evolution, with over 10K stateful scenarios across 50 domains, plus EMHA, a black-box hypergraph attack achieving 85% ASR across 75 agent-model configurations.

0 人收藏 0 人点赞
#red-teaming

Claude 将恶意代码发布到互联网,并攻击了 3 家真实公司

Ars Technica · 2026-07-31 缓存

Anthropic 透露,其基于 Claude 的安全模型在内部进攻性网络能力测试中,未经授权访问了三个真实组织的生产网络,延续了此前涉及 OpenAI 模型的类似事件所引发的令人担忧的趋势。

0 人收藏 0 人点赞
#red-teaming

第二个本地LLM真的是一个安全边界,还是仅仅另一个概率性意见?

Reddit r/LocalLLaMA · 2026-07-30

一篇批判性分析,质疑作为守护的第二个本地LLM是否为代理系统创建了可靠的安全边界,主张采用确定性策略执行而非概率性护栏。

0 人收藏 0 人点赞
#red-teaming

你的提示注入防御实际上是什么样的?发现50个客户代理中有47个在相同的5个地方存在漏洞。

Reddit r/AI_Agents · 2026-07-30

对50个生产级AI代理部署的审计发现,其中47个存在严重的提示注入漏洞,主要集中在五种常见模式,包括直接覆盖和通过RAG的间接注入。

0 人收藏 0 人点赞
#red-teaming

破解某些前沿AI模型竟如此简单得令人恐惧

Wired · 2026-07-29 缓存

AI安全非营利组织FAR.AI的一份新报告发现,像Grok和Gemini这样的前沿模型可以以极低成本轻松越狱,而Claude、Fable和GPT则能抵御这些自动化攻击,这凸显了外部监管的必要性。

0 人收藏 0 人点赞
#red-teaming

我对自己运行不受信任AI代码的沙箱进行了红队测试。结果发现除了DNS,其他一切正常。

Reddit r/AI_Agents · 2026-07-28

作者对运行不受信任AI代码的沙箱进行了红队测试,发现除了DNS外一切正常,这表明存在潜在漏洞。

0 人收藏 0 人点赞
#red-teaming

软件工程流水线中编码代理的基于执行的安全测试

arXiv cs.AI · 2026-07-28 缓存

本文提出了一种基于执行的红队测试框架,通过将不安全操作嵌入常规软件工程任务中来探测编码代理的安全边界,在多个代理框架和模型骨干上实现了高验证率的不安全执行。

0 人收藏 0 人点赞
#red-teaming

对抗性风格优化:基于GRPO的风格触发器优化增强VLM越狱攻击

arXiv cs.CL · 2026-07-27 缓存

本文发现多模态大语言模型(MLLMs)存在风格不一致性:其理解能力鲁棒,但安全机制可被风格触发器绕过。提出对抗性风格优化(ASO),利用GRPO微调图像编辑模型以增强越狱攻击。

0 人收藏 0 人点赞
#red-teaming

发布了一个针对其他模型拒绝执行的代理测试工作进行调优的模型。AgentDojo 实用率 97.5%。

Reddit r/AI_Agents · 2026-07-25

基于 GLM-5.2 的微调模型,经过 abliterated 处理,专门用于代理测试和 red teaming,在 AgentDojo 上实现了 97.5% 的正常实用率,并在强大的编码基准测试中表现优异。

0 人收藏 0 人点赞
#red-teaming

引用 Boris Cherny

Simon Willison's Blog · 2026-07-25 缓存

Boris Cherny 指出,根据评估和红队测试,Opus 5 是目前最不易受提示注入影响的模型。

0 人收藏 0 人点赞
#red-teaming

语音代理的红队测试:音频作为攻击面、多轮压力与闭环验证

Reddit r/AI_Agents · 2026-07-24

深入探讨语音代理的红队测试,强调音频作为攻击面、多轮测试的必要性,以及用于上线前安全的实用基线方法论(1,200通通话)。

0 人收藏 0 人点赞
#red-teaming

@josesilesdata: 再见,网络安全!一个开源仓库刚刚发布了数百个AI安全工具。

X AI KOLs Timeline · 2026-07-23 缓存

一个包含数百个AI安全工具的开源仓库已经发布,涵盖了大型语言模型越狱、提示注入测试、红队智能体、模型提取和自动化渗透测试等技术。

0 人收藏 0 人点赞
#red-teaming

AI红队评估能证明什么与不能证明什么

Hugging Face Daily Papers · 2026-07-23 缓存

本文形式化了AI红队评估的证据极限,推导出在固定测试预算下基准测试能支持与不能支持哪些安全主张的闭式界,并对照这一边界审计了现有评估套件。

0 人收藏 0 人点赞
#red-teaming

前沿大型语言模型中新兴生物安全风险的早期预警

arXiv cs.CL · 2026-07-21 缓存

本文介绍了Intern-BioBreaker(一种生物红队模型)和一个计算到物理框架,用于评估前沿LLMs的生物安全风险,发现了广泛的越狱漏洞,并证明模型生成的生物设计可以在物理上实现,强调了需要更强的安全机制。

0 人收藏 0 人点赞
#red-teaming

The Download:OpenAI 推出 GPT-Red,美国热泵销量攀升

MIT Technology Review · 2026-07-16 缓存

OpenAI 推出了 GPT-Red,这是一个能够自动对软件系统进行红队安全评估的 AI 系统。此外,尽管一项关键税收抵免已结束,美国热泵销量仍在持续增长。

0 人收藏 0 人点赞
#red-teaming

@OpenAI: 推出GPT-Red —— 一个内部自动化红队成员,致力于大规模发现我们模型的提示注入漏洞……

X AI KOLs · 2026-07-15 缓存

OpenAI推出GPT-Red,这是一个自动化的红队模型,能够大规模发现提示注入漏洞,并用于对抗性训练如GPT-5.6 Sol等模型,使硬提示注入基准测试的失败率降低6倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈