标签
Cherenkov是一个新的Apple Silicon推理引擎,使用预测专家流和混合精度执行,实现对像Qwen3.8-Flash-Next这样的大型AI模型的高效内存受限推理。
苹果推出Apple Watch Series 12,搭载全新的Health Sensing System和S11芯片,提供准确的心率和HRV监测、AI驱动的音频智能以及Siri AI集成。
NVIDIA Cosmos3,一个64B参数的图像生成模型,发布了INT4量化版本,支持在CUDA和MLX上本地部署,代码和权重可用,并在Apple Silicon上展示了性能。
Deltafin是一款开源工具,使得能够在像MacBook Pro这样的消费级硬件上运行完整的Kimi K3 2.8T参数模型,通过从固态硬盘流式传输数据,实现约每秒1个token的性能。
GameToMac 是一个新工具,允许用户在 Apple Silicon Mac 上以高帧率和稳定性玩 Age of Empires IV,并计划在未来支持更多 Windows 游戏。
Nativ v0.3.7 已发布,引入了诸如用于分组聊天的项目、导入/导出功能、新的语音模型以及针对 Apple Silicon Mac 增强的本地 AI 功能。
Perplexity 开源了一款针对 Qwen 3.6 模型优化的 Mac 推理服务器,以在 Apple Silicon 上实现最佳性能。
Perplexity已经开源了Lily,这是一个针对Apple Silicon优化的本地推理引擎,专门用于Qwen3.6-35B-A3B模型,实现了比MLX-LM快1.35倍的推理速度。
PyTorch 2.14 引入了重大更新,包括在 Inductor 中使用 NVGEMM 处理 CUTLASS 内核,用于分布式计算的新 nccl2 后端,高级容错性,以及在 Apple Silicon 上的原生线性代数。
Omarchy 正在开发一个适用于 Apple M 机器的精简安装程序,使用户可以通过下载应用并选择空间分配来轻松安装系统。
Apple的Lily引擎通过利用统一内存和硬件,优化了Apple silicon上的设备端LLM推理,性能超越MLX-LM,并针对Qwen3.6-35B-A3B模型架构进行了调优。
PyTorch 2.14 引入了对 Inductor、PyTorch Distributed、动态形状、Apple Silicon 支持等方面的更新,并有现场问答和 PyTorchCon 公告。
slotstream 是一个开源工具,它通过从SSD流式传输模型权重,使得在内存有限的Mac上运行像Qwen3.8-Flash-Next这样的大型AI模型成为可能,在48GB Mac上实现了大约12 tokens每秒的速度。
本文回顾了 Tim Cook 担任 Apple CEO 的 15 年任期,重点介绍了服务增长和 Apple Silicon 等关键成功,以及他领导期间的一些明显失误。
一位开发者分享了针对 llama.cpp 的 Metal 优化方案,可提升 Apple Silicon 上 IQ3_XXS 模型的解码速度,并在 GitHub 提交了拉取请求,呼吁社区参与测试。
GreenBench 是一个基准测试框架,用于评估 Apple Silicon 上开源 LLM 推理的能效和碳足迹,揭示其与数据中心 GPU 相比每令牌能耗优势达 30-40 倍,并识别不同使用场景下的最优模型。
本文报告了在MacBook Pro M5 Max上运行Qwen3.8-Flash-Next模型的情况,对100轮对话中速度与上下文深度进行基准测试,并深入分析性能及长上下文下角色混淆等问题。
MTPLX 框架在 Apple Silicon 上实现了 Qwen3.8 27B 模型 ~ 2 倍速度提升和 Qwen3.6 35B 模型 ~ 1.5 倍速度提升,具备自动调优和针对 MLX 模型的基准转换功能。
vphone-cli是一个命令行工具,可以在Apple Silicon Macs上使用Apple的Virtualization.framework虚拟化iPhone,具有固件修补、越狱和管理功能。
Asahi Linux 志愿者团队在逆向工程了摄像头和 USB 等组件后,几乎已准备好发布对 Apple M3 芯片的 Linux 支持,并且 M4 的计划已在进行中。