昨天在我的3090上跑了gemma 4 12b,我觉得本地模型领域已经变了

Reddit r/artificial 模型

摘要

一位用户报告称,通过GGUF量化在单张RTX 3090上本地运行了谷歌的Gemma 4 12B模型,发现其性能强劲,包括真实的256k上下文、多模态能力以及函数调用功能,在编码任务上甚至优于更大的70B模型。

发布后大约两小时我就跑起了gguf量化版本,我真的没想到一个12b模型能有这样的表现。多模态功能确实有效,我给它喂了代码库的截图,它解析架构的能力比我测试过的大多数70b模型都要好。256k上下文窗口是真实的,而且它不会像llama模型在超过32k时那样在边缘失效。我把整个代码仓库载入上下文,它能跟踪整个代码库中的引用。单张3090配合q4量化,运行速度大约每秒15个token,对开发工作来说完全可用。让我惊讶的是它的规模范围。12b模型处在一个甜区,你无需多GPU就能获得强大的推理能力。我在16GB内存的笔记本上试了e4b版本,速度较慢但功能齐全。我已经把它换入了我的本地编码流程。函数调用支持意味着我可以把它接入我的工具链,而无需之前那些蹩脚的变通方法。12b上的原生音频输入我还没尝试过,但这对语音驱动工作流程的潜在影响简直不可思议。
查看原文

相似文章