@AlmustyFX: 这才是真正重要的本地AI测试。一个7.9B MoE模型在M4 Pro上以152 tok/s运行,配备64GB统一内存…
摘要
一个7.9B MoE模型在M4 Pro上以每秒152个令牌的速度运行,配备64GB统一内存,能够离线处理敏感合同数据,并展示了本地AI的实际应用。
查看缓存全文
缓存时间: 2026/08/29 16:07
这正是那种真正有意义的本地AI测试场景。
一台搭载64GB统一内存的M4 Pro设备,以152 tok/s的速度运行7.9B参数MoE模型,全程离线处理敏感合同数据。
无需云端介入,数据永不离开设备。轻量化模型在一秒内即可完成实用工作。
本地AI正从演示阶段转变为真正的生产力工具。
洛一可🍥 (@luoyike2003): 把Ling-3.0-tiny的MLX 4bit版本拉到本地跑了一圈,记录实现流程、选型原因与遇到的问题
【硬件配置】Apple M4 Pro / 64GB统一内存 / macOS 26.5.1
【选择4bit版本的原因】
Ling-3.0-tiny采用7.9B总参数的稀疏MoE架构:每token仅激活1.3B参数,通过128个路由专家选取top-8并融合1个共享专家,网络深度24层,注意力机制为…
相似文章
我实测了:将密集27B模型换成30B-A3B MoE模型如何改变本地并发上限(与先前测试相同平台,仅改变一个变量)
作者在MacBook Pro上测试并比较了密集与MoE AI模型的并发性能,发现由于每个token的内存带宽使用更低,MoE模型的扩展性显著更好。
@analogalok: 在8GB显存上以20+ token/秒运行Gemma 4 26B MoE,支持250k上下文。如果你有8GB显存显卡,停下你正在做的事……
Alok演示了使用Unsloth的QAT量化以及llama.cpp中的-cmoe标志,在8GB显存上运行Gemma 4 26B MoE,实现了250k上下文下20 token/秒的速度,这标志着廉价本地AI的一个重要里程碑。
@ciruai:在配备128GB内存的AMD Ryzen AI Max+ 395 Strix Halo上测试DeepSeek v4 Flash。在中等长度上下文中获得约15 TPS……
在配备128GB内存的AMD Ryzen AI Max+ 395上测试DeepSeek v4 Flash,本地运行284B MoE模型(13B活跃参数)可达约15 TPS。成本仅需3000美元,而数据中心配置需25000美元以上,凸显了在消费级硬件上运行大型模型的可行性。
@analogalok:我刚刚在8GB RTX 4060上完全本地运行了Gemma 4 26B A4B MoE模型,搭配Hermes智能体,现在它正在回测交易策略……
一位开发者展示了在8GB RTX 4060上本地运行Gemma 4 26B MoE模型,结合Hermes智能体,完全自动化回测交易策略,凸显了本地LLM作为自主智能体的日益增强的能力。
@TheAhmadOsman: 天哪!27B模型低于6GB和4GB,本地AI将成为默认。附注:我们将尽快在ODS上由@OsmanticAI优化此功能…
Ternary Bonsai 27B,一个大型语言模型,被演示在NVIDIA RTX 5090 GPU上本地运行,内存需求低于6GB,使消费级硬件上实现端到端的智能代理工作流成为可能。