标签
通过实现一个基于Rust的守护进程来动态休眠不活跃的AI模型,本地代理的GPU内存使用可以从122 GB减少到43 GB,唤醒延迟低于200毫秒,使得在单个工作站上运行多个模型变得可行。
Quartermaster是一个开源本地AI平台,简化了模型管理、VRAM分配,并提供一个与OpenAI兼容的API,内置聊天游乐场,支持多种后端如llama.cpp和stable-diffusion.cpp。
本文介绍了一种为持续学习系统设计的统计决策层,允许专家池根据累积证据决定是重用现有模型、生成新模型还是推迟,具有管理非平稳数据流的理论保证和系统贡献。
一位开发者构建了 llmux,这是一个开源工具,用于简化跨不同引擎(如 vLLM 和 llama.cpp)管理模型配置,支持一键切换,并集成了 Docker 和 NVIDIA GPU 支持。
llama.cpp 现在通过API支持模型管理,包括下载和生命周期管理,无需外部工具即可完全部署。
EchoBird 是一个开源的桌面客户端,将 AI 工具安装、本地大模型运行和应用管理整合在一起,支持一键配置和统一接口管理。
oMLX v0.4.0 搭载了原生 Swift macOS 应用,具备重新设计的引导流程、设置界面、Hugging Face 缓存发现功能,以及改进的模型管理,用于在 Mac 上运行本地 AI。
一份实用指南,介绍如何通过分层包装系统和一致的目录结构来组织本地LLM实验,以避免模型位置漂移、标志遗忘和测试框架耦合。