标签
用户分享了他们在拥有32GB显存的RTX 5090上,使用Q8量化的Qwen3.6-27B模型尝试达到115K上下文长度的配置与实验过程,并给出了基准测试结果,以及上下文长度与kv-cache量化之间的权衡。
在 llama-server 中,Ornith 35B 与 Qwen3.6 35B DFlash 推测模型搭配使用时,token 生成速度提升了 30-40%,在混合代码和文本上实现了 80% 的接受率,但提示处理性能有所下降。
一份故障排除指南展示了将OpenClaw的contextInjection设置从 'always' 更改为 'continuation-skip' 后,如何解决使用 llama-server 时每次对话都会重载提示缓存的问题,从而在长时间会话中实现100倍的加速。
在 Docker 沙箱内安全运行 Pi AI 智能体,同时在主机上运行 llama-server 以进行本地 GPU 推理的指南。
作者使用本地Qwen 3.5-4B模型通过llama-server运行,将其Hermes代理升级为TencentDB Agent Memory,用于结构化JSON提取和多步骤工具调用,实现了一个基于游标检查点的弹性分层记忆流水线。
Llampart 1.0.0 是一个独立的本地 Web UI,用于 llama-server,支持多语言、扩展设置和精致的对话侧边栏,基于 MIT 许可证发布。
讨论Pi编码代理如何在llama-server上控制Qwen 35B A3B模型的思考长度,而其他客户端却无法做到。
Llama-Studio 是一个用于管理 llama-server 会话的 WebUI,支持配置、监控和控制多个实例,用于本地开发和实验。
Georgi Gerganov 分享了一条一行命令,用 llama-server 以默认投机解码设置启动量化版 27B Qwen3.6 模型。
作者分享了一套在 8GB RTX 4060 上跑 35B-MoE Qwen3.6 的可用 llama-server 配置,重点提示因内部推理无限制而耗尽 max_tokens 的陷阱,并给出用 per-request thinking_budget_tokens 的解决方案。