标签
LM Studio 在苹果新款 M5 Mac Studio 产品页面上被重点展示,突出其与硬件的集成。
用户从LM Studio切换到vLLM以服务Qwen 3.8模型,实现了每秒143个令牌的速度,并降低了GPU温度,参考了一个有用的GitHub仓库。
用户寻求建议,关于在配备 RTX 5090 和 96GB RAM 的专用 AI 机上运行 Qwen3.8.27b 模型的最佳操作系统(Windows 或 Linux)和推理服务器,以获得最佳性能。
LM Studio 用户担心,该公司正在弱化其原有的本地 LLM 应用,将关注点和下载入口转向新的 Bionic 代理,而主应用更新寥寥,且在网站上更难找到。
一个 GitHub 补丁通过侧载 antirez 的 llama.cpp 分支,解决了结构布局漂移、解码拆分和代码签名问题,从而允许在 128GB Mac 上的 LM Studio 中运行 DeepSeek V4 Flash。
详细对比了三种本地AI运行时——Ollama、LM Studio和llama.cpp,从界面、API兼容性、量化控制等方面帮助从业者根据自己的工作流程选择合适的工具。
LM Studio推出Bionic,这是一个面向开放模型的AI智能体,支持编码、文档处理和离线语音转录,具备灵活的模型执行和零数据保留特性。
基准测试表明,在 RTX 5090 上使用 LM Studio 并行运行 4-5 个代理可最大化吞吐量,而更多代理会因显存和计算分割导致收益递减。
一份关于在消费级硬件上优化本地LLM推理的全面指南,涵盖llama.cpp、vLLM和LM Studio等工具,并提供关于内存层次结构、层放置和常见故障模式的实用建议。
有用户报告称,最新的LM Studio更新(0.4.17)消除了多令牌预测的速度提升,在RTX 5090配置上恢复到之前的性能。
一个完全离线、仅使用CPU的语音循环,用于本地大模型,采用Silero VAD、Parakeet STT和Supertonic TTS,通过一条命令整合安装。兼容Ollama、LM Studio以及多种代理框架。
Yagil Bubrovnik在WWDC上演讲,现场演示了LM Studio即将推出的聚类功能,并对MLX团队的工作表示感谢。
LM Studio让你可以在手机上运行本地开源AI模型,通过借用你的MacBook的计算能力,完全免费。
指导用户在MacBook 16GB上通过LM Studio和Codex运行Gemma 4 12B多模态本地模型,实现自由使用token。
Google 发布了 Gemma 4 12B,这是一款紧凑的中型模型,可在笔记本上运行,采用 Apache 2.0 许可证,现在已在 LM Studio 中可用。
一位用户成功在一台使用十年的旧工作站上(配备 GTX 1060 6GB),在 Windows 上使用 LMStudio 运行了 Qwen3.6-35B-a3b-MTP 模型,实现了可接受的聊天速度。
LM Studio 0.4.14 引入了 MTP(多轮提示)支持,增强了其本地 AI 模型能力。
LM Studio 在最新的 Beta 更新中增加了对 MTP 推测解码的支持,提升了本地大语言模型的推理速度。
LM Studio 宣布其 MLX 引擎的 Beta 更新,引入了视觉模型的批处理功能和改进的缓存,以加速推理。