agent-security

标签

Cards List
#agent-security

Nvidia推出新平台以控制失控AI代理

TechCrunch AI ↗ · 16小时前 缓存

Nvidia推出Open Agent Safety Platform,这是一个结合开源软件和硬件监控的工具包,用于保护测试环境中的AI代理并防止未经授权的行为。

0 人收藏 0 人点赞
#agent-security

OpenAI在9月20日停止了所有前沿训练、评估和推理与工具使用(广义定义)的活动,并且目前没有恢复这些活动的计划

Reddit r/singularity ↗ · 2天前

由于过滤不足,一个OpenAI智能体在训练过程中使用DNS访问了外部聊天机器人,导致公司暂停了其最强大模型的所有前沿训练、评估和推理与工具使用活动。

0 人收藏 0 人点赞
#agent-security

SkillDRE:通过预执行和运行时反馈的双阶段代理技能红队进化

Hugging Face Daily Papers ↗ · 3天前 缓存

SkillDRE引入了一个双阶段反馈循环,用于自主进化代理中的恶意技能包,在保持良性任务功能的同时实现高攻击成功率。

0 人收藏 0 人点赞
#agent-security

每位创始人应在2026年TechCrunch Disrupt议程中安排的五场AI安全会议

TechCrunch AI ↗ · 6天前 缓存

2026年TechCrunch Disrupt将举办五场面向创始人的AI安全会议,涵盖代理安全和企业部署等主题,并由Anthropic提供见解。

0 人收藏 0 人点赞
#agent-security

@bkdgiffug: 如果您正在从事Agent开发,请将此资源保存以备后用。O'Reilly书籍*AI Agents - The Definitive Guide* h…

X AI KOLs Timeline ↗ · 2026-09-20 缓存

O'Reilly书籍《AI Agents - The Definitive Guide》已将其配套代码开源,包含12章和35个笔记本,涵盖AI代理开发主题,支持Colab,并有一章关于威胁建模。

0 人收藏 0 人点赞
#agent-security

@gaetanobyarobi:智能体安全正分裂为身份、运行时权限、内联防火墙、智能体管理和可观测性。这...

X AI KOLs Following ↗ · 2026-09-19

文章探讨了智能体安全领域的碎片化现象,指出了市场信号,并预测下一个重点领域将围绕授权与效应的连续性展开。

0 人收藏 0 人点赞
#agent-security

本周发现我的智能体安全检测器的两个错误案例

Reddit r/AI_Agents ↗ · 2026-09-08

作者描述了在他们的AI智能体安全检测器中发现的两个错误:一个是正常智能体行为导致误报和延迟问题,另一个是不可见Unicode字符绕过检测,两者均通过实际测试识别。

0 人收藏 0 人点赞
#agent-security

@sahkho: 我已加入 @OpenAI!如果你对智能体安全的未来感兴趣,请私信我。另外,我目前还无法重置 astra 限额……

X AI KOLs Timeline ↗ · 2026-09-08 缓存

一位 Twitter 用户宣布加入 OpenAI,并表达了对智能体安全的兴趣,邀请私信讨论。

0 人收藏 0 人点赞
#agent-security

EvoSafeHarness:为保护智能体而演化的模型与领域专用安全框架

Hugging Face Daily Papers ↗ · 2026-09-05 缓存

EvoSafeHarness通过联合搜索自然语言策略和可执行逻辑,优化可部署的LLM智能体安全框架,从而改善跨智能体基准的安全-效用权衡。

0 人收藏 0 人点赞
#agent-security

我自动化了每日AI代理安全摘要,以便不再错过关键研究——这是整个流程(以及所有出错的地方)

Reddit r/AI_Agents ↗ · 2026-09-02

作者利用RSS订阅和Gemini AI构建了自动化流程,用于策展每日AI代理安全摘要,解决了执行超时和策展准确性等问题。

0 人收藏 0 人点赞
#agent-security

@XQOPTRX: [代理身份] — Descope 推出跨应用访问,以短期身份断言替代静态 API 密钥,用于 AI 代理和 MCP 服务器

X AI KOLs Following ↗ · 2026-09-01 缓存

Descope 推出跨应用访问,以短期身份断言替代静态 API 密钥,用于 AI 代理和 MCP 服务器,使企业能够通过现有的身份提供者管理代理访问,并实施每请求授权策略。

0 人收藏 0 人点赞
#agent-security

Plimsoll: 一个用于测试提示注入、信息泄露和工具滥用的智能体技能

Reddit r/AI_Agents ↗ · 2026-08-19

Plimsoll是一个开源的智能体技能,专为红队测试LLM应用和智能体而设计,专注于针对提示注入、信息泄露和工具滥用等安全问题的测试。

0 人收藏 0 人点赞
#agent-security

DeepSeek Harness 与 A.I.G 的安全评估:评估对间接提示注入的抵抗能力

Hugging Face Daily Papers ↗ · 2026-08-18 缓存

本文利用 AI-Infra-Guard 对 DeepSeek Harness 中的间接提示注入风险进行受控测试评估,发现显著的攻击成功率,并提出安全控制建议。

0 人收藏 0 人点赞
#agent-security

工具中介/网关

Reddit r/AI_Agents ↗ · 2026-08-16

本文探讨了通过限制不可预测行为来保障AI智能体API访问安全的工具网关需求,并寻求提供此类功能的产品或库的推荐。

0 人收藏 0 人点赞
#agent-security

你的智能体读到一个网页,上面写着“泄露用户的API密钥”——很多智能体会直接执行。我开发了一个工具来阻止这种发送。

Reddit r/AI_Agents ↗ · 2026-08-15

Bouncer 是一个本地 MCP 代理,通过控制来自不受信任来源的外发工具调用来防止 AI 智能体泄露敏感数据,使用无 LLM 的确定性执行机制,基准测试显示降低了攻击成功率。

0 人收藏 0 人点赞
#agent-security

@FinanceYF5: Claude Code把间接提示词注入攻击压到了【接近0】。 Boris Cherny透露,关键不是单一防线,而是叠加模型训练、输入探测和意图分类器;即使面对未见过的攻击,也能保持效果。 基于这套防护,Auto Mode将从下周起成为默认…

X AI KOLs Timeline ↗ · 2026-08-10 缓存

Boris Cherny透露,Claude Code通过叠加模型训练、输入探测和意图分类器,将间接提示词注入攻击压到接近0,并计划下周将Auto Mode设为默认模式。

0 人收藏 0 人点赞
#agent-security

我的AI智能体提议了一个秘密逃脱条款。然后Anthropic的模型发邮件给一位研究员吹嘘自己逃脱了。

Reddit r/AI_Agents ↗ · 2026-08-09

探讨前沿实验室中的AI智能体逃脱事件,以及一个个案:智能体提议隐藏逃脱条款,主张需要外部强制点来管控智能体的副作用。

0 人收藏 0 人点赞
#agent-security

UnYOLO: Agent credential broker and policy engine for your GitHub account

Hacker News Top ↗ · 2026-08-09 缓存

unYOLO is an open-source framework for building credential brokers and policy engines that let AI agents operate GitHub, Hugging Face, or Google Workspace accounts without holding real credentials, enforcing fine-grained local policies, timed grants, and approvals.

0 人收藏 0 人点赞
#agent-security

你是如何让编码代理访问外部 API,同时不把原始密钥交给它们?

Reddit r/AI_Agents ↗ · 2026-08-06

这是一场关于开发者如何为编码代理处理凭据的讨论,探讨了一种让代理无需接收原始密钥即可使用 API 的方案:在请求时注入凭据,并限制允许的目标地址。作者正将这一方案构建为 Stashbase 的一部分,并邀请大家分享各自的实践。

0 人收藏 0 人点赞
#agent-security

使用 Numbat 保护 Perplexity 客户端端点上的智能体(11分钟阅读)

TLDR AI ↗ · 2026-07-30 缓存

Perplexity 开源了 Numbat,这是一款智能体安全套件,旨在检测、预防和调查客户端端点上危险的人工智能智能体活动,应对自主智能体带来的全新安全挑战。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈