中美AI能力差距对实际生产工作负载是否仍有意义?
摘要
作者反思了中国AI模型如DeepSeek和Hy3在生产工作负载中日益增强的效果,质疑中美AI能力差距对实际应用是否仍有意义。
今年我越来越多地使用中国模型。从DeepSeek开始用于推理任务,转向Qwen处理更长的上下文工作,在OpenRouter上当GLM有那个小DeepSeek时刻时尝试了它。目前,轮换主要是中国模型,Claude作为复杂创意任务的备用。这周我终于试了试Hy3,这让我更加确信了这一点。这个模型每个token激活21B参数,总共有295B参数。相比DeepSeek的671B或Kimi K3的2.8万亿,它很小。然而,对于我投入的编码和API集成工作,其输出质量比它应有的更接近那些模型。这是难以忽视的部分。当DeepSeek单独主导OpenRouter使用量,Qwen在Arena-Hard中领先,现在连像Hy3这样注重效率的小模型也能在实际任务中与它们匹敌……OpenAI和Anthropic的‘护城河’与我日常所见并不相符。如果这就是一个21B活跃模型在2026年中能做的,我真的不知道差距论点现在还基于什么。但这只是我的感受,我好奇其他人从自己的技术栈中看到了什么。
相似文章
@VraserX: 尽管中国最近获得了大量算力,为什么感觉他们仍在蒸馏美国模型?这…
一位评论者质疑,尽管中国获得了大量算力资源,为何似乎仍依赖于蒸馏美国AI模型,而非从头开始训练基础模型,想知道真正的瓶颈是什么。
真正的AI竞赛可能已不再处于前沿
本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。
这是中美之间的新战场。但北京有一个巨大优势
文章讨论了美中科技竞争,强调了中国在关键技术上的领先地位及其具有成本效益的AI模型,如DeepSeek和Kimi K3,这些模型威胁到了美国在人工智能行业的主导地位。
我们是否高估了AI能力转化为实际生产力的速度?
本文质疑AI展现的能力是否自动转化为实际生产力,强调了工作流所有权、可靠性以及与复杂人类系统集成等方面的差距。
美国的人工智能产业已经远远落后了。现在中国完全掌控了它。
这篇文章对比了中国在建筑和医学等领域的专家将AI作为工具的实际应用与美国专注于面向消费者的模型的做法,强调了中国的综合方法和伦理考虑。