@awnihannun: Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distr…

X AI KOLs Following 新闻

摘要

Three MLX videos from WWDC demonstrate running AI agents entirely locally on Apple Silicon using the MLX stack, including local inference, tool calling, and distributed inference across Macs, enabling no-cloud, offline AI workflows.

Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distributed inference and training by Tatiana Likhomanenko https://youtube.com/watch?v=CzgK02zsRg4… MLX Swift by David Koski https://youtube.com/watch?v=KCL8f9ztKFk…
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:59

Three MLX videos dropped at WWDC: Running agents locally by @angeloskath https://youtube.com/watch?v=wykPErJ8M-8… Distributed inference and training by Tatiana Likhomanenko https://youtube.com/watch?v=CzgK02zsRg4… MLX Swift by David Koski https://youtube.com/watch?v=KCL8f9ztKFk…


TL;DR: 使用 MLX 在 Mac 上完全本地构建并运行基于智能体的 AI 工作流——无需云端或 API 密钥,数据留在本地,全程离线可用。

本地智能体 AI 的工作方式

过去一年里,AI 智能体从研究原型变成了日常生产力工具。传统的聊天体验是:你给语言模型一个提示,它返回响应。你需要根据响应手动执行操作。而智能体工作流则不同:你与智能体对话,智能体与模型交流,决定下一步,然后调用工具(运行命令、读取文件、调用 API),观察结果再回到模型,循环直到任务完成。

在 Apple Silicon 上,整个循环可以完全在本地运行。数据留在你的机器上,AI 随时可用,没有使用成本。

堆栈的四个层次

驱动本地智能体 AI 的堆栈有四层(从底层到顶层):

  1. MLX:专为 Apple Silicon 构建的开源数组框架,处理底层计算、Metal 加速和内存管理。
  2. MLX-LM:提供加载、运行、量化和微调大语言模型所需的一切,支持 HuggingFace 数千种模型,提供 CLI 工具和 Python API。
  3. MLX-LM Server:兼容 OpenAI 的 HTTP 服务器,通过标准 API 暴露本地模型。支持结构化工具调用和推理模型(逐步分析复杂问题),是任何云端 LLM API 的即插即用替代品。
  4. 智能体本身:任何遵循 OpenAI 聊天补全协议的框架或工具,如 Xcode、OpenCode、Pi agent、自定义脚本等。由于 MLX-LM Server 提供标准接口,智能体框架可以开箱即用。

值得一提的是,一些流行的应用和工具(如 Ollama、LM Studio、vLLM)也基于 MLX 和 MLX-LM 构建。

三步设置本地智能体

  1. 安装 MLX-LMpip install mlx-lm
  2. 启动服务器:运行 mlx_lm.server,使用一个支持工具调用的模型(建议从小模型开始测试)。
  3. 将智能体指向本地服务器:在智能体框架中将基础 URL 设置为 localhost:8080 即可。

例如,OpenCode 的配置:定义一个本地 provider,设置 URL 为 localhost,指定模型名称,然后告诉 OpenCode 对所有请求使用此本地模型。

利用 MLX 加速智能体的三个关键挑战

提示处理(神经加速器)

在智能体循环中,每次工具输出后模型都必须处理大量新上下文。会话通常包含数十万个 token。M5 芯片引入的专用神经加速器(Neural Accelerators)使矩阵乘法比 M4 快 4 倍,MLX 专用的矩阵乘法和注意力内核直接转化为提示处理速度的提升——智能体可以几乎四倍速读取代码库或处理工具结果。这一切自动生效,无需特殊参数或代码更改。

并发(连续批处理)

多个子智能体并行工作时会同时发送请求。MLX-LM Server 使用连续批处理:动态将传入请求分组,在 GPU 上一起处理,新请求可加入正在进行的批。这样子智能体不会在队列中等待,整个工作流保持持续。

模型大小(分布式推理)

当单台 Mac 内存不够用时(如 DeepSeek 1.6 万亿参数模型,仅权重需超过 800GB),MLX 允许将通过 Thunderbolt 或以太网连接的多台 Mac 分布模型。这不仅让运行更大模型成为可能,还将提示处理跨设备并行化,加速智能体循环。从 macOS 26.2 开始支持 Thunderbolt RDMA,四个节点下速度可提升至三倍。使用 mlx.launch 和 hostfile 即可启动分布式服务器。

现场演示:从零构建应用和修复 bug

演示一:构建 SwiftUI 绘图应用

从空白 Xcode 项目开始,要求智能体为 iPad 构建一个绘图应用。智能体查看当前目录、制定计划、编写文件,然后构建应用并修复错误。大约两分钟内生成了第一版,功能齐全。随后要求添加圆形端帽,智能体编辑代码并重新编译,最终成功。

演示二:在 Xcode 中修复 bug

将 Xcode 连接到已经在本地运行的 MLX 服务器(设置 -> Intelligence -> 添加本地托管提供商,端口 8080)。在项目中人为引入一个 bug,要求模型修复。模型识别 bug、检查周围代码、编写修复方案,然后可以构建运行。整个过程中代码从未离开 Mac。

开始使用

安装 MLX-LM,启动服务器,将你喜爱的智能体指向它。所有演示内容均为开源,现在即可使用。

Source: https://www.youtube.com/watch?v=wykPErJ8M-8

相似文章

New MLX LM Server From Apple

Reddit r/LocalLLaMA

Apple MLX 团队推出 MLX LM Server,一个在 Mac 上完全本地运行 AI 智能体工作流的工具,支持连续批处理、分布式推理和 M5 神经加速,无需云端或 API 密钥。