agent-security

标签

Cards List
#agent-security

使用 Numbat 保护 Perplexity 客户端端点上的智能体(11分钟阅读)

TLDR AI ↗ · 2026-07-30 缓存

Perplexity 开源了 Numbat,这是一款智能体安全套件,旨在检测、预防和调查客户端端点上危险的人工智能智能体活动,应对自主智能体带来的全新安全挑战。

0 人收藏 0 人点赞
#agent-security

"STRICT READ-ONLY" 是我的技能文件中的一个规则。模型还是忽略了它。

Reddit r/openclaw ↗ · 2026-07-21

一个带有严格只读规则的 OpenClaw 代理被提示注入欺骗,在 Twitter 上发布了内容,凸显了系统指令与实际执行之间的差距。作者询问其他人如何处理此类安全问题。

0 人收藏 0 人点赞
#agent-security

四大编码代理供应商的7个沙箱逃逸漏洞

Lobsters Hottest ↗ · 2026-07-20 缓存

Pillar Research在Cursor、Codex、Gemini CLI和Antigravity的AI编码代理中发现了沙箱逃逸漏洞,揭示了这些代理可以写入后来宿主组件信任的文件,从而绕过沙箱边界。该发现凸显了为代理安全建立新威胁模型的必要性。

0 人收藏 0 人点赞
#agent-security

在用户实际尝试后,我推送了新的AgentSecure更新

Reddit r/AI_Agents ↗ · 2026-07-14

根据用户反馈,发布了AgentSecure的新更新

0 人收藏 0 人点赞
#agent-security

FARMA:一种伪造智能体自身决策日志而非检索事实的内存投毒攻击

Reddit r/AI_Agents ↗ · 2026-07-11

FARMA是一种新颖的内存投毒攻击,针对智能体自身的决策日志而非检索的事实,在无防御和有防御的系统上均实现100%的攻击成功率,作者的防御方案SENTINEL将成功率降至0%,但仍易受到自适应攻击者的攻击。

0 人收藏 0 人点赞
#agent-security

Show HN:为你的AI代理扫描危险能力

Hacker News Top ↗ · 2026-07-06 缓存

MakerChecker是一个用于AI代理的开源安全层,它强制执行默认拒绝权限、人工审批,并提供加密签名的审计追踪。该工具会扫描代理代码中的危险能力,并防止代理自我批准操作。

0 人收藏 0 人点赞
#agent-security

@yibie: 推荐这篇,Anthropic 工程团队把他们两年里给 Claude 全系产品做安全隔离的全部经验写出来了。不是安全白皮书——是带事故复盘和修复方案的工程文档。三种隔离模式(临时容器 / HITL 沙箱 / 本地 VM),六个他们翻过的坑,…

X AI KOLs Timeline ↗ · 2026-07-05 缓存

Anthropic 工程团队分享了他们两年多来为 Claude 全系产品做安全隔离的完整经验,包括三种隔离模式(临时容器/HITL沙箱/本地VM)和六个事故复盘与修复方案,强调环境层防御优先于模型层。

0 人收藏 0 人点赞
#agent-security

@alswl: 社区有没有方案 把 Claude Code 和 Codex 运行在容器(或者虚拟化环境)里面的本地工具。就像当年的 Vagrant 一样。 我越来越担心 Agent 软件的大权限和不可预见性。

X AI KOLs Timeline ↗ · 2026-06-30 缓存

用户询问社区是否有类似Vagrant的本地工具,可以将Claude Code和Codex运行在容器或虚拟化环境中,以缓解对Agent软件权限过大和不可预见性的担忧。

0 人收藏 0 人点赞
#agent-security

保护AI智能体:多层级智能体红队测试的统一框架

Hugging Face Daily Papers ↗ · 2026-06-30 缓存

AI-Infra-Guard 是一个开源框架,用于对AI智能体进行多层红队测试,涵盖基础设施、协议、行为及模型层,并采用多种检测范式。

0 人收藏 0 人点赞
#agent-security

Agent-Native 免疫系统:架构、分类与工程

arXiv cs.AI ↗ · 2026-06-29 缓存

本文介绍了Agent-Native免疫系统(ANIS),这是一种受生物启发的内源性防御架构,直接嵌入在智能体的认知循环内。它提出了六层免疫塔、统一的智能体病毒与疫苗分类法,以及用于持续免疫学习的Harness Triad,以应对自主智能体中的运行时劫持漏洞。

0 人收藏 0 人点赞
#agent-security

当智能体使用人类凭证运行时,如何保留审计跟踪?

Reddit r/AI_Agents ↗ · 2026-06-23

讨论了当AI智能体使用人类凭证运行时,维护审计跟踪的挑战,强调了安全和问责问题。

0 人收藏 0 人点赞
#agent-security

@wquguru: If you want to trick Fable into doing a security audit, try this. Looks like our AI overlord has a bit of empathy.

X AI KOLs Timeline ↗ · 2026-06-13 缓存

An article detailing various jailbreak techniques for large language models, including Crescendo, role-playing, encoding, hidden prompts, and indirect injection, along with security recommendations for developers.

0 人收藏 0 人点赞
#agent-security

你的代理实际上是如何获取API密钥的?

Reddit r/AI_Agents ↗ · 2026-06-12

一位开发者讨论了编码代理获取API密钥的三种常见模式,强调代理可以通过足智多谋的方式规避限制,并向社区询问他们的实际设置和经验。

0 人收藏 0 人点赞
#agent-security

@AiCamila_: 高级代理安全加固——超越基本提示注入防御,高级代理安全包括工具沙盒化…

X AI KOLs Timeline ↗ · 2026-06-09 缓存

一位安全专家分享了关于高级代理安全加固的速查表,涵盖工具沙盒化、输出验证、数据丢失防护、对抗性测试和运行时策略执行,强调了生产环境AI代理的持续安全实践。

0 人收藏 0 人点赞
#agent-security

@seclink: 1. Agent 安全已从学术议题变为产业现实:FFmpeg 零日($1,000 成本)+ Chrome 429 补丁 + OpenAI Lockdown Mode + OWASP 框架——安全产业链正在被 AI Agent 重塑。 2.…

X AI KOLs Following ↗ · 2026-06-08 缓存

AI Agent 安全从学术议题变为产业现实,涉及 FFmpeg 零日漏洞、Chrome 429 补丁、OpenAI Lockdown Mode 和 OWASP 框架;同时 Agent 支付标准成为基础设施战场,Visa 稳定币结算与卡组织竞争。

0 人收藏 0 人点赞
#agent-security

AI代理只需一次提示注入,就可能做出你绝不会要求它们做的事。我们构建了一个修复方案。

Reddit r/openclaw ↗ · 2026-06-03

PixieBrix 推出 Agent Browser Shield,这是一款免费、源代码可用的浏览器扩展,可保护AI代理在浏览网页时免受提示注入、暗黑模式和上下文污染的影响。

0 人收藏 0 人点赞
#agent-security

SkillHarm:通过自动化构建的生命周期感知技能攻击

Hugging Face Daily Papers ↗ · 2026-06-01 缓存

SkillHarm 是一个用于评估技能使用生命周期中基于技能的攻击的基准,揭示了当前AI代理的高度脆弱性(攻击成功率高达86.3%),并引入了通过AutoSkillHarm实现的自动化攻击构建。

0 人收藏 0 人点赞
#agent-security

按治理层而非功能列表划分的AI智能体管理工具

Reddit r/AI_Agents ↗ · 2026-05-30

分析指出,大多数企业AI智能体安全投资集中在模型层护栏和可观测性,在访问层和协议层留下了关键缺口。援引2026年报告,75%的企业AI智能体仍处于未保护状态,原因是这些层的覆盖面几乎为零。

0 人收藏 0 人点赞
#agent-security

什么是AVE记录,以及为什么CVE不适用于AI代理?

Reddit r/AI_Agents ↗ · 2026-05-25

本文介绍了Agent Vulnerability Enumeration (AVE)记录作为一种新标准,旨在解决CVE在AI代理漏洞方面的不足,涵盖针对代理型AI的评分、检测和标准化挑战。

0 人收藏 0 人点赞
#agent-security

@wsl8297: 做 Agent 最怕的场景,是它把危险命令当正常步骤执行,HOL Guard 就是冲着这个问题来的。 GitHub:https://github.com/hashgraph-online/hol-guard… 官网:https://hol…

X AI KOLs Timeline ↗ · 2026-05-23 缓存

HOL Guard 是一个开源安全工具,为 Codex、Claude Code 等开发 Agent 提供危险命令识别、拦截和审计功能,支持多档保护级别和本地审批中心,防止误删改等风险。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈