专家称利用Anthropic的Fable并非Kimi K3如此优秀的原因

TechCrunch AI 新闻

摘要

专家们对中国公司Moonshot通过蒸馏复制Anthropic的Fable模型来实现Kimi K3的先进能力表示怀疑,理由是时间不足和技术限制。

"我不认为在Fable之后仅靠严格蒸馏就能这么快得到一个如此强大的模型,"一位专家告诉TechCrunch。
查看原文
查看缓存全文

缓存时间: 2026/07/24 05:08

# 专家称利用Anthropic的Fable并非Kimi K3如此优秀的原因 | TechCrunch 来源:https://techcrunch.com/2026/07/23/experts-say-exploiting-anthropics-fable-isnt-how-kimi-k3-got-so-good/ 白宫科学顾问迈克尔·克拉齐奥斯表示,Moonshot——这家中国公司打造了目前最大的开源权重LLM Kimi K3——通过复制Anthropic的Fable LLM构建其模型,同时使用了未获批准出口至中国的芯片。 “旨在窃取美国专有技术并破坏美国研究的大规模、隐蔽的工业蒸馏行为是不可接受的,”克拉齐奥斯在社交媒体上写道(https://x.com/mkratsios47/status/2079933645888880708),当时有关禁止中国开源权重模型的讨论(https://techcrunch.com/2026/07/20/openai-is-scared-of-open-weight-models-should-the-us-be/)正引发AI领域的动荡。Moonshot未回应关于其训练过程的询问,克拉齐奥斯也未分享其指控的更多细节来源。 克拉齐奥斯的推文呼应了财政部长斯科特·贝森特的言论:“我们发现许多中国模型上都带有美国大型语言模型的水印,这是不可接受的。”目前尚不清楚这些水印由什么构成,财政部也未回应相关询问。 然而,专家们对蒸馏过程——即通过查询LLM以了解其内部运作并复制其能力——是否能解释Kimi K3展现出的先进能力表示怀疑。 “我不认为仅靠严格对Fable进行蒸馏,就能如此迅速地得到一个如此强大的模型,”Laude Institute研究员、Snorkel AI联合创始人Braden Hancock告诉TechCrunch。“坦白说,时间根本不够,对吧?Fable自7月1日才公开发布。你不可能在两周内蒸馏那么多数据、训练模型并发布它。” “我一直认为,随着中国模型越来越接近前沿,并且训练制度转向强化学习,蒸馏的作用正在越来越小,”艾伦人工智能研究所AI研究员Nathan Lambert在昨日发布的一期播客(https://www.interconnects.ai/p/open-models-recap-more-on-kimi-k3)中表示。“如果是这样,那么每个人都能通过蒸馏使用其数据轻松追上GLM或K3。但仅凭有监督微调,我们并未看到这种情况,或者说不会看到。” 执行蒸馏需要实验室系统地查询目标模型,以生成可用于后期训练的数据。有时这明确要求模型阐述其思维链,以理解其如何解决问题。其他情况下,模型的提示和响应被用于训练新模型,这一过程称为有监督微调(SFT)。 正是这一微调过程可能导致一个表面由第三方创建的模型声称自己是Claude。在Lambert看来,正是在微调中,“模型学会了它的举止”。 但Lambert表示,随着模型变得更加复杂,SFT的好处正变得越来越不重要。要蒸馏出类似Fable的能力,很可能需要强化学习技术。在许多情况下,这意味着让较大模型的一个代理对较小模型的响应进行评分,并根据评分进行调整。 更先进的技术也需要更显著的基础设施。大规模的强化学习运行可能需要数千万个代理。使用前沿实验室的API来进行这一操作“将极其昂贵,而且很可能成为时间瓶颈,因为这些模型相当慢,坦诚地说,甚至可能不会带来性能提升”。 似乎之前的前沿模型可能对Kimi有所贡献;Anthropic今年早些时候公开指责(https://www.anthropic.com/news/detecting-and-preventing-distillation-attacks)Moonshot、DeepSeek和MiniMax系统性地蒸馏其模型。Anthropic表示,它发现了其模型与它通过IP地址和其他元数据识别出的这些公司用户之间的数百万次交互。这些查询“与正常使用模式不同,反映了刻意的能力提取,而非合法使用”。Anthropic未回应TechCrunch关于Fable蒸馏的询问。 然而,蒸馏在AI公司中并不罕见,不仅限于中国。埃隆·马斯克今年早些时候作证称(https://techcrunch.com/2026/04/30/elon-musk-testifies-that-xai-trained-grok-on-openai-models/),他的公司SpaceXAI曾对OpenAI模型进行蒸馏以开发Grok,并且这种做法在行业中很普遍。例如,蒸馏与开发合成数据集之间的界限可能相当模糊。 “总体而言,美国人低估了这些中国团队的技术专长,”Hancock说。“Moonshot的一位创始人是CMU的博士生。这些都是做扎实工作的正规研究人员和工程师……如果美国模型停滞不前,我认为中国的进展会放缓,但仍会继续。他们并不仅仅是搭便车。” 此外,很难将蒸馏与克拉齐奥斯的评论的第二部分——即Moonshot获得了先进的Nvidia芯片Grace Blackwell 300,并使用了泰国配置GB300的服务器——分开。这些芯片被禁止出口到中国,但根据乔治城安全与新兴技术研究中心研究员Sam Bresnick的说法,存在黑市。今年5月,美国服务器制造商Supermicro的创始人因向中国走私先进芯片而被起诉。 “我支持在全球数据中心推行了解你的客户法规,”Bresnick说。“如果你允许一家公司在你最先进的硬件上进行大规模训练运行,就需要有一个报告机制,说明这家公司是谁,以及他们在做什么。” 拜登总统的商务部在2024年提出了针对数据中心的联邦了解你的客户规则(https://www.federalregister.gov/documents/2024/01/29/2024-01580/taking-additional-steps-to-address-the-national-emergency-with-respect-to-significant-malicious),但似乎在特朗普领导下没有取得进一步进展。然而,向国外运送先进芯片的出口商应当确保(https://www.mayerbrown.com/en/insights/publications/2026/01/administration-policies-on-advanced-ai-chips-codified)这些芯片仅用于批准的目的。 *当您通过我们文章中的链接购买商品时,我们可能会赚取少量佣金(https://techcrunch.com/techcrunch-affiliate-monetization-standards/)。这不影响我们的编辑独立性。* Tim Fernholz 是一名报道科技、金融和公共政策的记者。他密切跟踪了私营太空产业的崛起,并著有《火箭亿万富翁:埃隆·马斯克、杰夫·贝佐斯与新太空竞赛》一书。此前,他在全球商业新闻网站Quartz担任高级记者超过十年,职业生涯始于华盛顿特区的政治记者。您可以通过电子邮件 [email protected] 或通过 Signal 上的加密消息 tim_fernholz.21 联系或验证 Tim 的通讯。 查看简介(https://techcrunch.com/author/tim-fernholz/)

相似文章

Kimi K3 泄露:与 Fable 相当

Reddit r/LocalLLaMA

关于 Kimi K3 的泄露细节表明其性能与 Fable 相当,标志着 AI 模型领域的一个竞争性发展。