@davideciffa: Lucebox 的大日子!Codex、Hermes 和 OpenClaw 现在可以在搭载 Qwen3.6-27B 的推测性推理引擎上本地运行。F…
摘要
Lucebox 宣布,Codex、Hermes 和 OpenClaw 现在可以使用其推测性推理引擎配合 Qwen3.6-27B 模型在本地运行,并提供完整的 OpenAI 工具调用兼容性。
查看缓存全文
缓存时间: 2026/05/10 16:29
Lucebox 迎来重磅更新!Codex、Hermes 和 OpenClaw 现已通过搭载 Qwen3.6-27B 的推测推理引擎在本地运行。完全兼容 OpenAI 工具调用。感谢 @csujun 和 @jkyamog 的出色贡献。🏎️ https://t.co/grRUDT5CIy
相似文章
@pupposandro: 兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,...
Lucebox 引擎现在支持在单张 AMD Radeon AI PRO R9700 GPU 上运行 Qwen3.8-27B 模型,使用 DFlash2 drafter 进行无损验证,在代码任务上最高可达 227 tok/s。
@davideciffa:非常自豪地宣布,我们刚刚发布了 Luce KVFlash。在 Lucebox 中以 256k 上下文运行您偏好的模型,无需…
宣布发布 Luce KVFlash,这是一个在 Lucebox 中以 256k 上下文运行模型的工具,无需担心 KVCache 和 OOM,通过推测预填充和动态卸载,在长上下文场景下解码速度提升高达 2.9 倍。
Luce Megakernel: 为什么没有人谈论这个?
Lucebox Hub 为本地 LLM 推理提供优化的 CUDA 内核(Megakernel、DFlash、PFlash),在各种模型和 GPU 上相比 llama.cpp 实现了显著的加速(2-10 倍)。
Qwen 3.8 27b 发布:本地AI的重大新闻
Qwen 3.8 27b,一个参数小于300亿的AI模型,已经发布,适合在消费级硬件如RTX 3090或M4 Pro上进行本地推理,有可能取代基于云的AI订阅,并将工作流程转移到本地。
试了 Qwen3.6-27B-UD-Q6_K_XL.gguf 配 CloudeCode,真不敢相信居然能用
用户报告称,在 RTX 5090 本地运行 Qwen3-27B-UD-Q6_K_XL.gguf,200K 上下文速度约 50 tok/s,编码表现出乎意料地可用,标志着本地模型质量大幅跃升。