汇总最新开源项目、研究论文,助力开源LLM及相关硬件、软件的优化、效率与可访问性?

Reddit r/LocalLLaMA 新闻

摘要

本巨型帖子汇总了专注于优化推理、效率和可访问性的最新开源项目、研究论文及硬件创新,针对开源LLM及相关技术。

我从本子版块和网上无数帖子中收集了一些信息开始:推理和硬件优化项目 https://dwarfstar.sh/ - 推理引擎优化提案 https://github.com/JustVugg/colibri - 将VRAM、RAM和存储视为一个统一管理的推理内存层次结构,支持专家流式传输、缓存,并重点关注MoE。 https://openfreedom.it/ - 智能代理工具提案 https://github.com/exo-explore/exo - 异构/拓扑感知Mac集群的核心源代码 https://github.com/ml-explore/mlx/discussions/3481 - JACCL真实世界TB5传输实验 https://github.com/georgiedekker/mlx_distributed_ring_inference - 通过TCP/Ring在TB3/TB4上实现分布式推理,无需RDMA https://github.com/sqliteai/warp - WARP — 权重感知运行时和分页 https://github.com/kqb/mlx-od-moe - Apple Silicon上的按需专家:内存映射专家存储、影子预测器、预取器和LRU https://www.houmo.cn/1/35/NewsDetails.html - Houmo正在开发DRAM-PIM,将计算嵌入DRAM阵列,目标实现>1 TB/s内部带宽,相比当前一代能效提升约3倍。 https://www.d-matrix.ai/wp-content/uploads/2024/11/d-Matrix-WhitePaper-Technical-FINAL.pdf 和 d-Matrix 3DIMC公告 - 3D DRAM + 数字内存计算,与“将计算移向权重而非将权重移向计算”的理念高度契合 https://www.lucebox.com/ - 针对本地AI使用优化的工作站,价格约7000美元。 推理研究论文 MDI-LLM - 面向边缘LLM的模型分布式推理 跨低功耗节点进行模型分区,并采用循环管道并行以减少设备空闲时间。 MDI-LLM论文 WDMoE - 无线分布式混合专家 将专家分布在边缘/移动设备上,并联合优化专家选择和通信延迟。包括一个物理NVIDIA Jetson测试平台。 WDMoE论文 OD-MoE - 无缓存边缘分布式MoE推理的按需专家加载 与我们关于专家预测的想法高度相关。使用预测器提前几层预测专家,并在分布式节点上及时加载。报告了99.94%的专家预测准确率,并在测试设置中使用三分之一的GPU内存,达到完全缓存解码速度的约75%。 OD-MoE论文 MoE-SpeQ - 推测解码+主动专家预取 几乎直接关系到我们围绕流式MoE所提出的问题。草案模型预测未来专家,以便其传输可以与计算重叠。报告了相对于其卸载基线最高2.34倍的提升。 MoE-SpeQ论文 SP-MoE - MoE的推测解码和预取 推测感知专家卸载、推测专家预取、异步批处理I/O和计算/I/O管道化。 SP-MoE论文 MoE-Spec - 高效推测解码的专家预算 对“推测自动修复MoE”的重要反驳。显示验证更深推测树可能会激活太多唯一专家,增加内存压力;提出显式专家预算。 MoE-Spec论文
查看原文

相似文章

本地LLM推理优化:完整指南

Reddit r/LocalLLaMA

一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。