MacBook统一内存+大型LLM+热量

Reddit r/LocalLLaMA 新闻

摘要

一位用户讨论了在配备统一内存的MacBook Pro上运行大型LLM时产生的高热量问题,质疑其他人是持续运行这些模型还是仅用于基准测试,并寻求适合持续运行代理任务的小型模型推荐。

大家好,我看到很多人谈论他们如何能够加载大型LLM模型,因为他们拥有统一内存。像ds4等项目声称正在运行超大型LLM。但根据我的实验,加载接近满内存的模型会产生高热,MacBook Pro在进行此类计算时很容易达到100摄氏度。人们是持续运行这些模型,还是只是为了刷分和追热度?我正在寻找一个最小的模型,可以在我笔记本电脑上持续运行,作为类似HermesAgent这样的智能体的核心,来处理我的简单任务,比如待办事项列表或日历管理。
查看原文

相似文章

2台配备 512GB 内存的 M3 Ultra Mac Studio

Reddit r/LocalLLaMA

硬件投入约 2.5 万美元。告诉我你们希望我在这两台设备上部署什么模型,我会协助测试。目前我已通过 Exo 后端跑通了 DeepSeek v3.2 Q8 版本;当前每台设备均在运行 GLM 5.1 Q4(正在排查为何 Exo 无法加载 Q8 版本)。静候社区完成 Kimi 2.6 针对 MLX/mmap 的优化适配。

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。