@CuiMao: 你别说,你真别说,本地跑LM studio接一个Claude code,效果相当满意,5090开64k上下文,能跑200+token。
摘要
用户分享在本地使用LM Studio配合Claude Code的运行体验,称使用RTX 5090可实现64k上下文并达到每秒200+ token的生成速度,效果令人满意。
你别说,你真别说,本地跑LM studio接一个Claude code,效果相当满意,5090开64k上下文,能跑200+token。
查看缓存全文
缓存时间: 2026/04/21 08:58
你别说,你真别说,本地跑LM studio接一个Claude code,效果相当满意,5090开64k上下文,能跑200+token。
相似文章
@NFTCPS: 4GB显存跑70B大模型?这事儿真成了! AirLLM玩了个骚操作——分层推理,不一次性把模型怼进显存,而是一层层加载、算完就扔,硬生生把巨无霸塞进小破卡。 最骚的是:100%开源,白嫖警告 https://github.com/0xSo…
AirLLM 是一个完全开源的工具,通过分层推理技术(逐层加载并立即释放显存),使得 70B 大语言模型可在仅 4GB 显存的 GPU 上运行,无需量化、蒸馏或剪枝,并已支持 Llama3.1 405B 在 8GB 显存上运行。
@ai_xiaomu: macbook 16g 就能跑的满血多模态本地模型来了: 1. 下载LM studio; 2. 搜索gemma 4 12B 并下载安装; 3. 告诉codex帮你配置好本地api参数; 4. 接下体验token自由的感觉吧。
指导用户在MacBook 16GB上通过LM Studio和Codex运行Gemma 4 12B多模态本地模型,实现自由使用token。
@NFTCPS: 电诈园区又有新武器用了,语音克隆这块又被卷到新高度了。 LuxTTS,一个轻量级 TTS 模型,我看完只想说三个字:真离谱。 快:单卡 150 倍实时,连 CPU 都能跑得比真人说话还快 清:直接 48khz,大部分模型还卡在 24khz…
LuxTTS 是一个轻量级语音克隆 TTS 模型,支持 48kHz 高清输出,单 GPU 可达 150 倍实时速度,仅需 1GB 显存即可本地运行,性能媲美十倍大的模型。
@iluciddreaming: 玩了两个月本地 LLM。 用 Windows 11 + llama.cpp + llama-swap 狂测各种开源模型,这是我的最终成绩单: 硬件:i7-13700 + 64GB RAM + RTX 4070 目前最能打的组合是 gemm…
经过两个月本地 LLM 测试,作者认为 gemma-4-12B-it-QAT 和 MTP 辅助组合在速度和可用性上表现最佳,硬件为 i7-13700 + 64GB RAM + RTX 4070。
@cryptoresetlife: @support_huihui 在 Mac Studio M3 Ultra (512GB) 上成功部署无审查版 GLM5.2 754B 参数模型 (231GB GGUF),948 tokens / 4分25秒 ≈ 3.6 tokens/s
无审查版 GLM5.2 754B 参数模型(231GB GGUF)已成功部署在配备512GB内存的 Mac Studio M3 Ultra 上,实现了约3.6 tokens/s的速度。