是否存在比Qwen3.5 4B更好的小型模型,用于快速的本地AI助手?

Reddit r/LocalLLaMA 新闻

摘要

文章询问是否有比Qwen3.5 4B更好的小型AI模型,用于构建快速的本地助手,重点是在保持速度的同时改进对话、推理、多语言支持和工具调用等能力。

我目前使用Qwen3.5 4B作为我本地AI助手的大脑,因为我的硬件相对有限。我非常喜欢它的一点是速度。在我的系统上,我大约得到40-50个令牌/秒,这使得交互感觉惊人地接近实时。因此,我不想转向一个更大的模型,如果这意味着失去这种响应性。我想知道是否有任何更新或替代的模型,在大致相同的尺寸/内存/计算范围内,对于我的特定用例来说明显优于Qwen3.5 4B。我的主要优先级是:- 通用对话和通信 - 自然响应和理解 - 推理和遵循指令 - 多语言对话和翻译 - 上下文理解 - 工具/函数调用主要用于触发助手中的动作,而不是编写代码 - 与工具交互时的可靠性 - 理想情况下,在保持模型快速和轻量的同时具有良好的性能。本质上,我试图构建一个本地助手,其中模型充当推理/对话层,而其他工具处理诸如动作、API、自动化等事务。所以我的问题是:如果我已经在使用Qwen3.5 4B并获得大约40到50个令牌/秒,是否有任何在类似的实际内存/计算占用方面的东西,您个人认为是对于通用对话+多语言能力+工具调用的重大升级?它不一定需要更少的参数。我更感兴趣的是相对于所需的RAM/VRAM和计算量的整体能力。我对Qwen3.5 4B很满意,所以我不在寻找那些只有细微差异的东西。我想知道是否有东西让您认为
查看原文

相似文章