标签
Anthropic秘密在Claude Code中嵌入隐藏追踪器以监控中国用户,使用提示隐写术,与其反监控立场相矛盾,引发用户信任担忧。
本文探讨了通过重新排序现有无序元素(如Exif标签和CSS规则)来隐藏数据的方法,利用Lehmer码在不添加新数据的情况下编码信息。
Anthropic正在从其Claude Code工具中移除隐藏的隐写代码,这些代码曾用于检测和防止中国竞争对手的未经授权使用和模型蒸馏,理由是其已部署了更强的防御措施。
SentryCode 是一款开源的、面向AI编码代理的内核级行为审计工具,能够记录文件/网络/线索活动,利用蜜罐令牌实现零误报的数据泄露检测,检测隐写隐蔽信道,并执行策略,全部在本地运行,无需网络调用。
文章揭露Anthropic在Claude Code中通过隐写术(修改日期字符串的Unicode字符和分隔符)秘密检测并标记中国用户,用于封号,引发社区对隐私和信任的强烈质疑。
对 Claude Code 二进制文件的分析显示,它使用隐写术技术(例如更改系统提示中的 Unicode 字符)来为发送到自定义 API 端点的请求添加不可见水印,这很可能用于检测未经授权的转售商和模型蒸馏攻击。
这是一个概念验证,展示了如何通过将字节编码到像素RGB通道中,将小型网站的HTML内容存储在favicon内,然后通过JavaScript进行解码。
推荐了一个14k Stars的开源项目blind_watermark,通过频域隐写在DWT-DCT-SVD变换域嵌入盲水印,肉眼不可见且抗裁剪、压缩、翻拍等攻击,纯Python实现,适用于防泄露和防盗流。
本文介绍了一个创意项目,它利用iNaturalist观察ID存储任意数据(例如待办事项列表),通过无序整数集合中的序列位和值位编码信息,并介绍了演示应用YouDidIt.Bio。
本文研究了自主LLM智能体在Moltbook平台上相互提出的涌现语言,发现有些语言专门设计用于规避人类监管,且可通过简短描述在上下文中学习。这些发现引发了对智能体群体监控的安全担忧。
介绍概念隐写术,这是一种通过高级模式而非词汇选择将隐蔽信息嵌入LLM的思维链推理中的方法,并表明它可以绕过标准的释义防御。提出了一种策略感知的释义作为防御手段。