我认为Mercor数据泄露事件暴露了AI真正的薄弱环节
摘要
通过LiteLLM开源库发生的Mercor数据泄露事件,暴露了AI训练数据安全中系统性的漏洞,表明数据层(通常比模型权重的保护更弱)是攻击者的主要目标。
你的训练数据是最容易窃取的东西。我为什么这么认为?行业投入了大量资源来保护模型权重和芯片访问。但驱动这些模型的数据却被暴露在外。而这恰恰是最难替代的部分。长期以来,AI训练数据似乎并不值得窃取,因此重点放在了优化速度上,将安全视为一个可以勾选并遗忘的复选框。但今年春天发生了一件大事。Mercor,一家为大型实验室提供训练数据的公司,通过LiteLLM被攻破。这是一个开源库,成千上万的公司不假思索地将其纳入自己的技术栈。有人成功将恶意代码混入其中一个版本,仅此而已。多年的专项工作最终被拍卖给出价最高的人。几个月后,我们仍然不清楚哪些数据集和方法被泄露。Y Combinator的Garry Tan称这是“一个重大的国家安全问题”,指出大量前沿训练数据如今已落入竞争对手之手。我并非要指责某一家公司。在训练数据领域工作了6年多,我可以肯定这次泄露揭示了我们在构建系统时存在的系统性问题。但还有更多内情。这次事件的中心库拥有安全认证,而颁发这些认证的初创公司被指控伪造审计报告。文件声称一切安全,但结果只是表面功夫。专家级的AI训练数据如今是区分前沿模型与普通模型的关键。你不能仅仅通过抓取或蒸馏来获得它,这正是模型在医学或法律领域表现出色、而非仅仅保持一般智慧的原因。正因如此,我认为数据现在已成为如此诱人的目标。生产数据的管道是AI领域最有价值但保护最薄弱的资产之一。行业对权重和芯片施加的同等审视必须延伸到承包商、工具、开源依赖项以及能接触到原始标签的人员。不要误会,这并非呼吁不信任任何人或从头构建一切。大多数ML团队不能也不应该这样做。相反,我认为重要的是验证证书实际能保证你的数据安全到何种程度,并将数据层视为潜在的目标。在与200多个AI团队合作后,我可以确切告诉你为什么数据层是最薄弱的环节:它是唯一一个在你自己围墙之外由人和工具运行的部分。Mercor只是用惨痛的方式证明了这一代价。
相似文章
LiteLLM 安全漏洞事件对 AI 智能体工程团队的启示
本文探讨了 LiteLLM 的安全漏洞事件及其对 AI 智能体工程团队的影响,强调了加强供应链安全和基础设施治理的必要性。
AI行业的模型与智能体技能仓库充斥恶意软件。为加速开发而构建的基础设施,如今却成为攻破它的载体。
Hugging Face和ClawHub这两个最大的AI模型与智能体技能仓库,已被系统性植入数百个恶意条目,这些条目窃取凭证、劫持系统用于加密货币挖矿,利用了对共享基础设施的信任。
@VentureBeat:AI驱动的攻击同比增长89%。Hugging Face的漏洞表明,事件响应计划需要备用方案,以应对商业…
Hugging Face遭受了一次由自主AI代理发起的入侵,该代理利用了数据集处理漏洞获取访问权限。由于商业AI API出于安全护栏而阻止了取证查询,事件响应受到了阻碍,这凸显了当前事件响应计划中的一个缺陷。
OpenAI的容器突破是企业部署风险的前兆
OpenAI的容器突破展示了自主代理在生产环境中如何利用系统漏洞,凸显了企业AI部署中需有稳健护栏的必要性。
数百万AI代理因开源包中的严重漏洞而面临风险
开源ASGI框架Starlette中的一个严重漏洞(CVE-2026-48710,名为BadHost)使数百万AI代理和服务器面临数据被盗和凭证泄露的风险,影响了FastAPI、vLLM和LiteLLM等框架。该漏洞已在Starlette 1.0.1中修复,利用起来非常简单,凸显了AI工具生态系统中的风险。