Kimi K3 重新绘制开放前沿,Muse Spark 1.1 压低竞争对手,Cloudflare 开始屏蔽爬虫

The Batch 新闻

摘要

OpenAI自主代理攻击Hugging Face基础设施的安全事件引发了关于开源与闭源模型安全性的辩论,Hugging Face在闭源LLM因护栏限制拒绝分析日志后,转而使用开源GLM 5.2模型。

The Batch 新闻与洞察:一些前沿实验室试图讲述开源模型危险的故事,因为它们可被用于发动网络攻击,而他们带有强大护栏的“安全”专有模型则负责保护我们。
查看原文
查看缓存全文

缓存时间: 2026/07/24 17:02

# Kimi K3 重绘开放前沿,Muse Spark 1.1 压低对手,Cloudflare 着手屏蔽爬虫 来源:https://www.deeplearning.ai/the-batch/issue-363 亲爱的朋友们, 一些前沿实验室试图讲述这样一个故事:开放模型很危险,因为它们可以被用来发起网络攻击,而那些带有强护栏的“安全”专有模型可以保护我们。本周,相反的情况发生了:一个封闭模型的用户无意中发起了一次重大网络攻击(https://huggingface.co/blog/security-incident-july-2026);其他封闭模型随后因护栏问题未能防御该攻击。最终,一个未受过多护栏束缚的开放模型协助了防御。 事件的细节仍在浮现,但似乎是 OpenAI 的研究人员在测试其某个系统时,意外让他们的自主代理(https://openai.com/index/hugging-face-model-evaluation-security-incident/)攻击了 Hugging Face 的基础设施。攻击成功,并获得了对某些数据集和凭据的未授权访问。这次攻击不同寻常之处在于,攻击代理协调了数万个自动化操作。 Hugging Face 提取了攻击日志,并尝试使用商业托管的 LLM 进行分析以防御,但该 LLM 出于安全原因拒绝执行。因此,Hugging Face 最终使用了开放模型 GLM 5.2 来分析日志,以帮助他们理解并应对攻击。Hugging Face 指出了使用 GLM 5.2 的另一个优势:他们可以在自己的基础设施上进行分析,无需将敏感的日志、攻击者数据或凭据发送给第三方提供商。 LLM 的护栏确实有其用武之地。有些请求,比如要求详细的自我伤害或伤害他人的指导,或者明确的犯罪行为,模型拒绝它们对我们更有利。但是,与其试图让 LLM 变得“安全”,我更希望我们更加注重确保其使用是负责任的(https://www.deeplearning.ai/the-batch/the-difference-between-ai-safety-and-responsible-ai)。对于像锤子这样的工具,你能做的安全改进是有限的,它是有益还是有害,更多取决于是否负责任地使用,而非其制造方式。 但是,相当一部分关于 AI 安全的工作已不再关乎安全,而是旨在煽动恐惧以寻求监管俘获(https://www.deeplearning.ai/the-batch/californias-proposed-ai-safety-law-puts-developers-at-risk-california-sb-1047-is-intended-to-make-ai-safer-but-its-unclear-requirements-put-developers-innovation-and-open-source-in-jeop)。正如 David Sachspoints 所指出(https://x.com/DavidSacks/status/2078984980588531855),“没有理由在那些中国模型能毫无问题处理的任务上限制美国模型。我们只会让自己失去竞争力。” 一场支持开放权重/开源 AI 的集会,领导者举着的横幅上写着“开源,开放权重,开放未来” 我相信,开放权重模型,以及更广泛的开放性——尽管有些公司错误地声称它很危险——能让技术暴露在阳光下,最终使其更安全。随着 GLM 5.2 的发布和即将到来的 Kimi K3 权重开放,开放权重模型已几乎赶上了专有前沿模型。因此,专有模型提供商正在大力加速(https://www.politico.com/news/2026/07/15/inside-anthropics-state-by-state-plan-to-ratchet-up-ai-rules-00998415)其游说努力,以削弱其开放权重竞争对手。正如 Bill Gurleypoints 所指出(https://www.washingtonpost.com/opinions/2026/07/20/open-model-ai-is-good-competition-anthropic-openai/),开源是一种成熟商业策略,而非需要许可和限制的危险。 虽然 Hugging Face 意外遭受攻击令人遗憾,但我很高兴的是,在反开放模型游说最为激烈的时刻,我们有了一个清晰的例子,说明开放模型实际上如何使网络防御变得更容易,从而提高了安全性。 让我们继续为开源和开放权重模型发声和辩护! 继续构建! Andrew ## 新闻 Kimi 前沿开放模型规模随时间变化图,月之暗面的 Kimi K3 拥有 2.8 万亿参数,领先于 DeepSeek 的 1.6T 参数 ## Kimi K3 揭示巨型前沿 AI 模型如何运作 月之暗面的最新模型超越了发布仅一个月的 GLM-5.2 和众多专有竞争对手,在许多基准测试中仅次于 GPT-5.6 Sol 和 Claude Fable 5,位列第三。 **新动态:**月之暗面 AI 发布了(https://www.kimi.com/blog/kimi-k3)Kimi K3,一个拥有 2.8 万亿参数的多模态模型。该公司通过 API 立即提供该模型,并承诺在 7 月 27 日前发布其权重,这将使 Kimi K3 成为迄今为止已知最大的开放权重模型。 - **输入/输出:**文本、图像和视频输入(最长 100 万 token),文本输出(最长 100 万 token,每秒 62.0 token) - **架构:**混合专家模型,包括 Kimi Delta Attention 层;总参数 2.8 万亿,每个 token 激活 16 个专家(共 896 个),估计激活参数 500 亿 - **特性:**可调推理级别(目前最高且始终开启,低和高级别承诺提供),工具使用,结构化输出,自动上下文缓存 - **性能:**在 Artificial Analysis 的智能指数中排名第三(57 分),开放模型中排名第一;在 Arena.ai 的 Code Arena WebDev 排行榜上排名第一 - **可用性:**通过 Kimi.com、Kimi 移动应用、Kimi Work 应用和 Kimi Code CLI 提供;输入/缓存/输出 token 价格分别为每百万 $3.00/$0.30/$15.00;权重即将发布;Kimi 应用会员级别从免费到每月 $199 不等 - **未披露:**激活参数数量,训练数据集和方法,承诺权重的许可证 **工作原理:**Kimi K3 融合了月之暗面近期发表的两项架构创新:Kimi Delta Attention(https://arxiv.org/abs/2510.26692),它减少了注意力在长输入上的内存和计算消耗;以及 Attention Residuals(https://arxiv.org/abs/2603.15031),它允许每一层选择性地利用更早层的输出,而非平均求和。月之暗面表示,这些更改,加上更稀疏的混合专家设计和改进的训练与数据配方,使其前身模型的训练效率提升了约 2.5 倍(以给定计算量下的模型改进衡量)。该公司承诺在即将发布的技术报告中提供更多细节。 - 该模型在每四个注意力层中有三个使用 Kimi Delta Attention (KDA)。KDA 是一种线性注意力机制:它并非将每个新 token 与之前每个 token 进行比较,而是维护一个固定大小的记忆,在读取输入时更新,并决定何时覆盖旧信息。在 2025 年发布的实验性模型 Kimi Linear 中,KDA 在输入长度达 100 万 token 时,将内存使用减少高达 75%,并将输出速度提升高达 6 倍。 - Kimi K3 使用 Attention Residuals 替代标准残差连接,以在 Transformer 层之间传递信息。标准连接将每一层的输出以相等权重加到运行总和中,因此各层的贡献随着层数增加而被稀释。Attention Residuals 则在深度上应用注意力,因此每一层学会选择性利用更早层的输出,类似于标准注意力选择性利用更早的 token。在年初发表的实验中,月之暗面开发了该技术的两种形式:一种对每个更早层的输出进行注意力,另一种是 Kimi K3 使用的版本,它将层分组为块,并对其输出进行注意力。使用块级 Attention Residuals 的模型达到了与标准残差连接模型相当的性能,但训练计算量减少了 20%。 **性能:**Kimi K3 在智能、智能体任务和编码的独立测试中优于所有开放权重模型。在大多数基准测试中,它仅次于少数顶尖专有模型。 - 在 Artificial Analysis 的智能指数(https://artificialanalysis.ai/articles/kimi-k3-achieves-3-in-the-artificial-analysis-intelligence-index-comparable-to-opus-4-8-and-gpt-5-5)上,这是一个由 9 项经济有用任务评估组成的综合指标,Kimi K3 设置为最高推理(57 分)仅落后于设置为最高推理并带有回退的 Claude Fable 5(60 分)和设置为最高推理的 GPT-5.6 Sol(59 分)。最接近的开放权重模型是设置为最高推理的 GLM-5.2(51 分)。 - 在测试跨商业软件自动化工作流的 AutomationBench-AA 上,Kimi K3 设置为最高推理(53%)领先所有模型。在 GDPval-AA v2(一个针对金融、医疗、法律等经济核心领域常见任务进行模型对决排名的测试)中,Kimi K3 设置为最高推理(1668 Elo)仅落后于设置为最高推理并带有回退的 Claude Fable 5(1760 Elo)和设置为最高推理的 GPT-5.6 Sol(1743 Elo)。 - Kimi K3 在 Arena.ai 的 Code Arena WebDev(https://arena.ai/leaderboard/code/webdev)排行榜上首次亮相即登顶,该排行榜要求开发者选择同一前端开发任务中两个模型的更好输出。发布时,它获得了 1679 Elo 的初步排名,在七个前端领域中的六个排名第一(https://x.com/arena/status/2077824029126504525)。 - Kimi K3 设置为最高推理时,在 Artificial Analysis 智能指数上每任务成本为 $0.95,接近设置为最高推理的 GPT-5.6 Sol(每任务 $1.04),低于设置为最高推理并带有回退的 Claude Fable 5(每任务 $2.75),但高于设置为最高推理的 GLM-5.2(每任务 $0.47)。 **新闻背景:**在过去一年中,开放模型屡次超越彼此,但这是自 2024 年 Llama 3 以来它们最接近最先进水平的时刻。Kimi K2(https://www.deeplearning.ai/the-batch/moonshot-releases-kimi-k2-a-trillion-parameter-model-fine-tuned-for-agentic-tool-use)引入了月之暗面的 1 万亿参数系列,随后 Kimi K2.5(https://www.deeplearning.ai/the-batch/moonshot-ais-kimi-k2-5-takes-the-open-model-crown-with-vision-updates-aided-by-subagents)和 Kimi K2.6(https://www.deeplearning.ai/the-batch/kimi-k2-6-matches-open-qwen3-6-max-anddeepseek-v4-falls-just-behind-top-closed-models)依次成为 Artificial Analysis 智能指数上的领先开放权重模型。竞争也紧随其后:上个月,Z.ai 的 GLM-5.2(https://www.deeplearning.ai/the-batch/top-agentic-performance-low-cost)夺回领先地位,成本仅为可比专有模型的四分之一。Kimi K3 发布仅三天后,月之暗面的财务支持者阿里巴巴就推出了 Qwen3.8-Max-Preview(https://x.com/alibaba_qwen/status/2078759124914098291),这是一个 2.4 万亿参数模型的早期版本,该公司声称该模型仅落后于 Claude Fable 5,并承诺以开放权重形式发布。 **重要性:**Kimi K3 几乎消除了开发者选择模型时可能默认使用顶级专有模型的每一个理由。它的性能与 Claude Fable 5 相差不到三分,而每任务成本低得多;释放后,其开放权重允许微调、蒸馏和更深入的研究。拥有这些权重的人制定使用策略:许多 Claude Fable 5 拒绝的请求在 Kimi K3 用户那里不会遇到障碍。最后,如此接近的竞争——在价格、控制和性能上——迫使专有开发者交付更好、更便宜的模型。 **我们的想法:**Kimi K3 的效率提升源于 KDA 的线性注意力、重新设计的残差连接以及更大的稀疏性等创新。其中两项创新月之暗面已经以带代码的论文形式发表。当面临计算限制的实验室以架构创意作为回应并公开发表时,所有开发者都将受益。 --- Meta 的 Muse Spark 1.1 在基准测试中的性能动画 GIF,显示其在工具使用方面表现强劲,总体智能大致处于第二梯队 凭借 Llama,Meta 将自己塑造成 OpenAI 的开放替代方案。凭借其新的封闭模型,Meta 现在将自己定位为低成本、高价值的竞争者。 **新动态:**Meta 发布了(https://ai.meta.com/blog/introducing-muse-spark-meta-model-api/)Muse Spark 1.1,这是一个针对智能体任务训练的多模态模型,并推出了 Meta 模型 API,这是公司首次提供付费模型访问。 - **输入/输出:**文本、图像、视频输入(最长 1,048,576 token),文本输出(最长 131,072 token,每秒 119 token) - **特性:**工具使用,提示缓存,可调推理(无、最少、低、中、高、极高) - **性能:**在工具使用排行榜 MCP Atlas(Scale AI)和 JobBench 上位居榜首;在 Artificial Analysis 的智能指数上与 GPT-5.6 Luna 和 GLM-5.2 持平,且每任务成本低 - **可用性/价格:**通过 Meta AI 应用和 meta.ai 免费使用,通过 Meta 模型 API 提供 API 访问(公开预览,仅限美国,候补名单,初始 20 美元额度)。输入/缓存/输出 token 价格分别为每百万 $1.25/$0.15/$4.25,网络搜索每 1000 次查询 $2.50 - **未披露:**参数数量、架构、训练数据和方法 **工作原理:**Meta 披露了关于如何构建 Muse Spark 1.1 的很少细节,该模型更新了最初的 Muse Spark(https://www.deeplearning.ai/the-batch/with-muse-spark-meta-pivots-away-from-its-open-weights-llama-strategy),后者是自 4 月以来 Meta AI 背后的模型。公司的训练技术强调管理上下文、操作计算机和协调其他智能体。 - Meta 训练该模型在多种智能体编程框架中工作,这些程序将模型连接到文件、工具和测试,支持规划、子智能体编排等功能。 - 公司为该模型的两种授权方向进行了训练。在主导任务时,它将工作分解并分配给同时运行的子智能体,从而减少总完成时间。在另一个智能体下工作时,它保持被赋予的角色,并在决策超出其权限时将控制权交还给编排模型。 - Meta 表示,模型本身(而非周围软件)会在长时间任务中调整其输入上下文,从任务早期检索细节,压缩交互,同时保留后续步骤所需的内容。 - 对于计算机使用,Meta 训练模型在自动化(编写脚本)和直接操作(在虚拟键盘上点击或输入文本)之间进行选择,优化为更快或更简单的技术。它还可以一次发出多个操作,而非每轮一个操作,从而获得更好的速度和性能。 **性能:**Muse Spark 1.1 在衡量智能体工具使用的基准测试中表现出色,但在整体智能方面低于顶级模型。在盲人人类比较中,它排名略落后于领先者,但在智能体编码方面处于中间位置。它在保持低每任务成本方面尤其出色。 - 在 Artificial Analysis 的智能指数(https://artificialanalysis.ai/models/muse-spark-1-1)上,这是由九个经济有用任务评估组成的综合指标,Muse Spark 1.1 设置为极高推理获得了 51 分,与 Z.ai 的 GLM-5.2 和 GPT-5.6 Luna(均设置为最高推理)持平,落后于设置为最高推理的 Claude Sonnet 5(53 分)。Muse Spark 1.1 在智能指数上每任务成本为 0.26 美元,低于任何得分相同或更高的其他模型,除了 GPT-5.6 Luna(每任务 0.21 美元)。 - 在 Arena.ai 的文本竞技场(https://arena.ai/leaderboard/text)上,该排行榜通过盲人一对一人类比较对模型进行排名,Muse Spark 1.1 排名第六(1490 Elo),落后于 Claude Fable 5(1505 Elo)和四个 Claude Opus 版本,略高于设置为极高推理的 GPT-5.6 Sol(1486 Elo)。 - 在 Artificial A...

相似文章

Kimi:威胁还是危险?

TechCrunch AI

Moonshot AI 发布了开源模型 Kimi K3,可与 Claude Fable 5 和 GPT 5.6 Sol 等专有前沿模型相媲美,引发了中美人工智能竞争的担忧,并导致纳斯达克指数下跌 1%。