@awnihannun: Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distr…
摘要
Three MLX videos from WWDC demonstrate running AI agents entirely locally on Apple Silicon using the MLX stack, including local inference, tool calling, and distributed inference across Macs, enabling no-cloud, offline AI workflows.
查看缓存全文
缓存时间: 2026/06/09 08:59
Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distributed inference and training by Tatiana Likhomanenko https://youtube.com/watch?v=CzgK02zsRg4… MLX Swift by David Koski https://youtube.com/watch?v=KCL8f9ztKFk…
TL;DR: 使用 MLX 在 Mac 上完全本地构建并运行基于智能体的 AI 工作流——无需云端或 API 密钥,数据留在本地,全程离线可用。
本地智能体 AI 的工作方式
过去一年里,AI 智能体从研究原型变成了日常生产力工具。传统的聊天体验是:你给语言模型一个提示,它返回响应。你需要根据响应手动执行操作。而智能体工作流则不同:你与智能体对话,智能体与模型交流,决定下一步,然后调用工具(运行命令、读取文件、调用 API),观察结果再回到模型,循环直到任务完成。
在 Apple Silicon 上,整个循环可以完全在本地运行。数据留在你的机器上,AI 随时可用,没有使用成本。
堆栈的四个层次
驱动本地智能体 AI 的堆栈有四层(从底层到顶层):
- MLX:专为 Apple Silicon 构建的开源数组框架,处理底层计算、Metal 加速和内存管理。
- MLX-LM:提供加载、运行、量化和微调大语言模型所需的一切,支持 HuggingFace 数千种模型,提供 CLI 工具和 Python API。
- MLX-LM Server:兼容 OpenAI 的 HTTP 服务器,通过标准 API 暴露本地模型。支持结构化工具调用和推理模型(逐步分析复杂问题),是任何云端 LLM API 的即插即用替代品。
- 智能体本身:任何遵循 OpenAI 聊天补全协议的框架或工具,如 Xcode、OpenCode、Pi agent、自定义脚本等。由于 MLX-LM Server 提供标准接口,智能体框架可以开箱即用。
值得一提的是,一些流行的应用和工具(如 Ollama、LM Studio、vLLM)也基于 MLX 和 MLX-LM 构建。
三步设置本地智能体
- 安装 MLX-LM:
pip install mlx-lm - 启动服务器:运行
mlx_lm.server,使用一个支持工具调用的模型(建议从小模型开始测试)。 - 将智能体指向本地服务器:在智能体框架中将基础 URL 设置为
localhost:8080即可。
例如,OpenCode 的配置:定义一个本地 provider,设置 URL 为 localhost,指定模型名称,然后告诉 OpenCode 对所有请求使用此本地模型。
利用 MLX 加速智能体的三个关键挑战
提示处理(神经加速器)
在智能体循环中,每次工具输出后模型都必须处理大量新上下文。会话通常包含数十万个 token。M5 芯片引入的专用神经加速器(Neural Accelerators)使矩阵乘法比 M4 快 4 倍,MLX 专用的矩阵乘法和注意力内核直接转化为提示处理速度的提升——智能体可以几乎四倍速读取代码库或处理工具结果。这一切自动生效,无需特殊参数或代码更改。
并发(连续批处理)
多个子智能体并行工作时会同时发送请求。MLX-LM Server 使用连续批处理:动态将传入请求分组,在 GPU 上一起处理,新请求可加入正在进行的批。这样子智能体不会在队列中等待,整个工作流保持持续。
模型大小(分布式推理)
当单台 Mac 内存不够用时(如 DeepSeek 1.6 万亿参数模型,仅权重需超过 800GB),MLX 允许将通过 Thunderbolt 或以太网连接的多台 Mac 分布模型。这不仅让运行更大模型成为可能,还将提示处理跨设备并行化,加速智能体循环。从 macOS 26.2 开始支持 Thunderbolt RDMA,四个节点下速度可提升至三倍。使用 mlx.launch 和 hostfile 即可启动分布式服务器。
现场演示:从零构建应用和修复 bug
演示一:构建 SwiftUI 绘图应用
从空白 Xcode 项目开始,要求智能体为 iPad 构建一个绘图应用。智能体查看当前目录、制定计划、编写文件,然后构建应用并修复错误。大约两分钟内生成了第一版,功能齐全。随后要求添加圆形端帽,智能体编辑代码并重新编译,最终成功。
演示二:在 Xcode 中修复 bug
将 Xcode 连接到已经在本地运行的 MLX 服务器(设置 -> Intelligence -> 添加本地托管提供商,端口 8080)。在项目中人为引入一个 bug,要求模型修复。模型识别 bug、检查周围代码、编写修复方案,然后可以构建运行。整个过程中代码从未离开 Mac。
开始使用
安装 MLX-LM,启动服务器,将你喜爱的智能体指向它。所有演示内容均为开源,现在即可使用。
相似文章
@awnihannun: @angeloskath 关于使用MLX构建本地自主AI的视频非常出色。我还听说这是观看次数最多的视频之一……
一条推文强调了Angelos Kath在WWDC上关于使用MLX构建本地自主AI的出色视频,指出开源权重模型和硬件能力的快速进展。
New MLX LM Server From Apple
Apple MLX 团队推出 MLX LM Server,一个在 Mac 上完全本地运行 AI 智能体工作流的工具,支持连续批处理、分布式推理和 M5 神经加速,无需云端或 API 密钥。
@ddalcu: 过去4天本地AI真是疯狂……太不可思议了…… https://github.com/ddalcu/mlx-serve/releases/tag/v26.8.2… @liquidai ……
一位开发者更新了 MLX-Serve(一个面向 Apple Silicon 的快速本地推理服务器),以支持近期模型,如 LiquidAI 2.6B、MiniMax H3 视频生成和 DeepSeek V4 Flash,AntLing 3.0-flash 即将推出。
我为Apple Silicon打造了最快的本地AI引擎。专为代理式使用优化。
作者宣布发布'lightning-mlx',这是一个针对Apple Silicon优化的本地AI引擎,可为编码代理和工具调用工作流实现高令牌速度。
Nativ:在您的Mac上本地运行AI模型
Nativ是一款新的macOS桌面应用,它封装了MLX以在本地运行AI模型,提供聊天界面和API服务器。