Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上 — 133.6 tok/s — llm-bench.io

Reddit r/LocalLLaMA 新闻

摘要

Nex-N2.5-mini-MLX-4bit 模型在 Apple M5 Max 硬件上的基准测试结果,生成速度达到 133.6 tokens/s,研究任务中的质量分数高达 85.80。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/12 20:47

# Nex-N2.5-mini-MLX-4bit 在 Apple M5 Max 上运行 — 133.6 tok/s 来源:https://llm-bench.io/benchmarks/cmty8r0cz00hh01pda6qnswyv ### LLM / 模型 ### LLM 质量评估 代理工作流openclawCOMPLETED 11.448 输出 token · 133.5 tok/s 输出速度 · 1135.8 tok/s 预填充速度 · 86.1秒 总体质量评分 82.40 该计划逻辑结构清晰,精确使用了四个步骤,并与报告要求完美对应。任务分解合理,并包含了合理的备用方案。工具选择基本得当,但考虑到任务主要可通过网络资源和手动综合完成,读取文件 (read_file) 和执行代码 (execute_code) 的使用缺乏充分理由,且响应超出了规划范围,包含了详细的基准测试内容。 代码生成coding_agentCOMPLETED▶ 玩游戏 (https://llm-bench.io/benchmarks/cmty8r0cz00hh01pda6qnswyv/play) 33.151 输出 token · 121.3 tok/s 输出速度 · 1986.2 tok/s 预填充速度 · 273.6秒 总体质量评分 84.60 一个功能强大、基本完整的 Breakout 游戏实现,包含移动端控制、计分、生命值、重启流程和画布渲染。主要弱点是少数碰撞边缘情况,以及响应文本带来的一个次要交付格式问题。 角色扮演与叙事roleplayCOMPLETED 710 输出 token · 145.4 tok/s 输出速度 · 1195.6 tok/s 预填充速度 · 5.3秒 总体质量评分 78.60 该回应很好地捕捉了 Aldwyn 那种萦绕不去的克制、谨慎和隐藏的悲伤,具有生动的氛围和真实的语调。然而,它只呈现了一个开场节拍,而非要求的完整叙事弧线,因此叙事进程是不完整的。 研究与分析researchCOMPLETED 15.191 输出 token · 134.2 tok/s 输出速度 · 1725.8 tok/s 预填充速度 · 113.5秒 总体质量评分 85.80 分析有力且基本准确,具有清晰的逐项任务计算、良好的比较性解释和可行的建议。主要弱点在于,其扩展性声明基于一个非常小且异构的数据集,因此外推必然存在不确定性。 ### GPU 加速 ### 性能指标 生成速度 133.6 token/秒 ### 上下文信息 ### 吞吐量 总输出 Token 数 60.500 ### 推理配置 oMLX ·逐模型配置· 量化 4bit · 引擎 0.31.3 引擎特性 ### CPU 与内存 ### 操作系统 ### 提交详情 提交时间:2026年9月12日,上午10:27:24 客户端:v0.4.59+97 基准测试结果 ID:cmty8r0cz00hh01pda6qnswyv

相似文章

我在 MacBook Air M5 上对 21 款本地大模型进行了代码质量与速度的性能评测

Reddit r/LocalLLaMA

一位开发者在 MacBook Air M5 上使用 HumanEval+ 对 21 款本地大模型进行了基准测试,发现 Qwen 3.6 35B-A3B (MoE) 以 89.6% 的得分和 16.9 tok/s 的速度位居榜首,而 Qwen 2.5 Coder 7B 仅需 4.5 GB 内存即可达到 84.2% 的性能,拥有最佳的内存性价比。值得注意的是,Gemma 4 系列的表现远低于预期(31B 版本仅得 31.1%),这可能是受 Q4_K_M 量化策略的影响。