中美AI能力差距对实际生产工作负载是否仍有意义?

Reddit r/ArtificialInteligence 新闻

摘要

作者反思了中国AI模型如DeepSeek和Hy3在生产工作负载中日益增强的效果,质疑中美AI能力差距对实际应用是否仍有意义。

今年我越来越多地使用中国模型。从DeepSeek开始用于推理任务,转向Qwen处理更长的上下文工作,在OpenRouter上当GLM有那个小DeepSeek时刻时尝试了它。目前,轮换主要是中国模型,Claude作为复杂创意任务的备用。这周我终于试了试Hy3,这让我更加确信了这一点。这个模型每个token激活21B参数,总共有295B参数。相比DeepSeek的671B或Kimi K3的2.8万亿,它很小。然而,对于我投入的编码和API集成工作,其输出质量比它应有的更接近那些模型。这是难以忽视的部分。当DeepSeek单独主导OpenRouter使用量,Qwen在Arena-Hard中领先,现在连像Hy3这样注重效率的小模型也能在实际任务中与它们匹敌……OpenAI和Anthropic的‘护城河’与我日常所见并不相符。如果这就是一个21B活跃模型在2026年中能做的,我真的不知道差距论点现在还基于什么。但这只是我的感受,我好奇其他人从自己的技术栈中看到了什么。
查看原文

相似文章

真正的AI竞赛可能已不再处于前沿

TechCrunch AI

本文讨论了开放权重模型(尤其是来自中国公司的模型)在生产型AI工作负载中日益占据主导地位,这挑战了像Anthropic和OpenAI这样的公司的前沿模型的相关性。