LM Arena 已经过时了吗?
摘要
一位用户批评 LM Arena 没有收录最近的开源模型(如 Qwen3.6 和 Step 3.7 Flash),质疑该平台在比较新开源模型与闭源模型方面的相关性。
过去每当有新的开源模型发布,我都会查看 LM Arena 来了解它们与大型闭源模型相比如何。但现在看来,它们除了最大的模型之外,大幅减少了展示新发布的开源模型。没有收录任何 Qwen3.6 模型实在离谱。连 Step 3.7 Flash 这样相当重要的模型,它们也没有展示出来。
相似文章
还有人完全忽略这些大规模的“开放权重”发布吗?
一位社区成员表示,像 GLM-5.2(7530 亿参数)这样的巨大开放权重模型由于极高的显存需求,实际上无法在本地自托管,并认为这一趋势背离了本地 AI 社区的初衷,令人沮丧。
评估开源大语言模型在自主代号游戏模拟中的表现
一位开发者构建了一个代号游戏模拟平台,用于评估开源大语言模型在长程协作中的表现。结果显示,DeepSeek v4 Flash 在游戏逻辑对齐方面表现优异,胜出其他模型;而 Qwen 3 Next 和 GPT 5.4 Nano 则在规则约束和视角转换方面存在困难。
Ling 3 tiny 是否因体积小巧而被低估?
一位用户讨论了 Ling 3 tiny 模型的基准测试,将其与 Qwen3.5 9b 进行比较,并质疑是否其他开源模型被忽视了。
开源权重大语言模型与闭源大语言模型之间的差距
使用Artificial Analysis Intelligence Index和其他基准测试分析开源权重与闭源大语言模型之间的差距,发现在某些指标上差距正在缩小,但在其他指标上保持稳定。
@DeRonin_: 中国开源大语言模型完全取代所有新发布的模型,它允许你本地训练自己的LLM,是的,门槛…
一条推文声称中国开源大语言模型已经完全取代了新发布的模型,允许本地训练,不过对业余开发者而言门槛提高了。