mlx

标签

Cards List
#mlx

我让Codex优化了oMLX上的DeepSeek V4 Flash 8-bit MLX,实现了约1.6倍的预填充速度和3倍的解码加速。

Reddit r/LocalLLaMA · 2026-07-05

作者使用Codex优化了oMLX上的DeepSeek V4 Flash 8-bit MLX,实现了约1.6倍的预填充速度和3倍的解码加速。

0 人收藏 0 人点赞
#mlx

@MaziyarPanahi: 我们获得了每秒755个token!这是OpenMed privacy-filter v2(nemotron,MLX 8位)读取一份13,000个token的临床文件…

X AI KOLs Timeline · 2026-07-04 缓存

OpenMed privacy-filter v2使用nemotron和MLX 8位,在Mac上实现了每秒755个token的处理速度,从一份13,000个token的临床文件中脱敏了22个类别的1,152个PII标识符,且数据从未离开本机。

0 人收藏 0 人点赞
#mlx

prism-ml/Ternary-Bonsai-27B-mlx-2bit

Hugging Face Models Trending · 2026-07-04 缓存

Prism ML 发布了 Ternary-Bonsai-27B-mlx-2bit,这是一个三元量化的 27B 参数语言模型,在约 7.2 GB 内存下实现了 FP16 性能的约 95%,使笔记本电脑能够进行完整推理。

0 人收藏 0 人点赞
#mlx

@0x0SojalSec: 别再为ElevenLabs或云端TTS付费了。只需3秒即可在笔记本电脑上完全本地克隆声音,将你的文档转…

X AI KOLs Timeline · 2026-07-01 缓存

一个免费、完全本地的语音克隆和TTS工具,由Qwen3-TTS和Kokoro驱动,通过MLX在Apple Silicon上运行,无需云服务即可从PDF生成工作室级有声书。

0 人收藏 0 人点赞
#mlx

@ollama:Gemma 4 在 Apple Silicon 上使用 Ollama 和 MLX 提速近 90%!性能提升得益于改进的多 token 预…

X AI KOLs Following · 2026-07-01 缓存

Ollama 宣布,Gemma 4 在 Apple Silicon 上使用 MLX 后速度提升近 90%,这得益于默认启用的改进多 token 预测机制,并支持自动调节以避免减速。

0 人收藏 0 人点赞
#mlx

@QuixiAI: QuixiAI/ThunderMittens(从 @HazyResearch 分支)将 ThunderKittens(以及几乎所有其他内容)移植到 Metal。现在可以…

X AI KOLs Following · 2026-06-29 缓存

QuixiAI 将 ThunderKittens 移植到了 Metal,从而在 MPS 和 MLX 上实现了内核支持,使得可以在 Mac 上训练模型。

0 人收藏 0 人点赞
#mlx

MLX微调示例指南

Reddit r/LocalLLaMA · 2026-06-29

一份关于在 Apple Silicon 上使用 MLX 和 LoRA 微调 7B 指令模型的详细指南,附有显示风格适应高奇幻文学语域的示例输出。

0 人收藏 0 人点赞
#mlx

从零开始使用MLX构建大语言模型

Reddit r/LocalLLaMA · 2026-06-24

一份关于使用Apple的MLX框架从零开始构建大语言模型的指南。

0 人收藏 0 人点赞
#mlx

650多个Apache-2.0许可的生物医学NER/去标识化模型,在MLX中设备端运行。相同fp32权重,输出一致:临床NER模型在3年前的M3 Max上比PyTorch-CPU快30-40倍。内部可复现。

Reddit r/LocalLLaMA · 2026-06-23

650多个Apache-2.0许可的生物医学NER和去标识化模型集合,通过MLX在设备端运行,在M3 Max上实现比PyTorch-CPU快30-40倍的推理速度,且输出一致。

0 人收藏 0 人点赞
#mlx

@cevenif: 用苹果电脑跑本地大模型的朋友,有个工具值得盯上——Rapid-MLX。它在 M 系列芯片上的推理速度比 Ollama 快 2 到 4 倍,因为它是直接基于苹果的 MLX 框架开发的,对芯片架构的压榨更彻底。 几个关键点: KV 缓存裁剪加…

X AI KOLs Timeline · 2026-06-18 缓存

Rapid-MLX 是一个针对苹果 M 系列芯片优化的本地大模型推理工具,基于 MLX 框架开发,推理速度比 Ollama 快 2 到 4 倍,支持多种模型、工具调用及 OpenAI API 兼容接口。

0 人收藏 0 人点赞
#mlx

@pcuenq:GLM 5.2 刚刚发布,现在已经在两台 Mac Studio(M3 Ultra)上通过 MLX 运行。这相当于……

X AI KOLs Timeline · 2026-06-16 缓存

GLM 5.2 是一款与顶级闭源模型相媲美的开放权重 AI 模型,现已发布,并在两台 Mac Studio(M3 Ultra)上通过 MLX 运行。

0 人收藏 0 人点赞
#mlx

@no_stp_on_snek: MiniMax-M3 的 Config-I 量化版本已发布在 MLX 上。2-bit 专家、4-bit 注意力、8-bit 边界与嵌入、f16 路由器。约…

X AI KOLs Following · 2026-06-16 缓存

发布了 MiniMax-M3 的 Config-I 量化版本,在 MLX 上使用 2-bit 专家和 4-bit 注意力,将 427B MoE 模型从 869GB 减少到约 167GB,但该量化版本未经测试且需要为 mlx_lm 打补丁。

0 人收藏 0 人点赞
#mlx

React Native ExecuTorch 现已支持 Gemma 4(Vulkan 和 MLX 加速)

Reddit r/LocalLLaMA · 2026-06-15

react-native-executorch 库现已集成 Google 的 Gemma 4 模型,可实现完全离线的 GPU 加速推理,在 Android 上使用 Vulkan 委托,在 Apple Silicon 上使用 MLX 委托。

0 人收藏 0 人点赞
#mlx

@ActuallyIsaak:这是一个实际运行的端到端过程,从训练到在LM Studio中使用训练好的LLM,由@lmstudio的MLX-LoRA-Studio提供

X AI KOLs Following · 2026-06-14 缓存

MLX-LoRA-Studio 是一款原生的macOS应用,用于在Apple Silicon上微调LLM,提供用户友好的界面,支持多种训练算法,包括SFT、DPO和QAT。它完全开源,允许本地私有微调,无需依赖云端。

0 人收藏 0 人点赞
#mlx

@julien_c:这是个好消息:由@jundotkim开发的oMLX现在支持标准的HF缓存模型目录。为本地AI打造的优秀MLX服务器…

X AI KOLs Following · 2026-06-12 缓存

oMLX是一款用于本地AI的MLX服务器,现在支持标准的Hugging Face缓存模型目录,简化了模型加载过程。

0 人收藏 0 人点赞
#mlx

@awnihannun: @angeloskath 关于使用MLX构建本地自主AI的视频非常出色。我还听说这是观看次数最多的视频之一……

X AI KOLs Following · 2026-06-12 缓存

一条推文强调了Angelos Kath在WWDC上关于使用MLX构建本地自主AI的出色视频,指出开源权重模型和硬件能力的快速进展。

0 人收藏 0 人点赞
#mlx

MTPLX V1:用于运行和创建MLX MTP模型的Swift应用(2倍TPS的Qwen 3.6 27B)

Reddit r/LocalLLaMA · 2026-06-12

MTPLX V1是一款原生Mac应用,集成了用于MLX模型的MTP投机解码引擎,提供通过Forge进行模型转换、内置聊天、基准测试以及支持较小模型等功能。它实现了超过2倍的加速,且数学上精确无误。

0 人收藏 0 人点赞
#mlx

@yagilb: 我今年有幸在WWDC上演讲,在舞台上现场演示@lmstudio即将推出的聚类功能…

X AI KOLs Following · 2026-06-10 缓存

Yagil Bubrovnik在WWDC上演讲,现场演示了LM Studio即将推出的聚类功能,并对MLX团队的工作表示感谢。

0 人收藏 0 人点赞
#mlx

发布 Cohere North Mini Code

Reddit r/LocalLLaMA · 2026-06-09

Cohere正式发布North Mini Code编程模型,权重可在Hugging Face上获取,并支持vLLM和MLX部署。

0 人收藏 0 人点赞
#mlx

@awnihannun: Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distr…

X AI KOLs Following · 2026-06-09 缓存

Three MLX videos from WWDC demonstrate running AI agents entirely locally on Apple Silicon using the MLX stack, including local inference, tool calling, and distributed inference across Macs, enabling no-cloud, offline AI workflows.

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈