@pupposandro: 兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,...

X AI KOLs Timeline 新闻

摘要

Lucebox 引擎现在支持在单张 AMD Radeon AI PRO R9700 GPU 上运行 Qwen3.8-27B 模型,使用 DFlash2 drafter 进行无损验证,在代码任务上最高可达 227 tok/s。

兴奋地宣布 Lucebox 引擎现在可以在单张 AMD Radeon AI PRO R9700 (32 GB, RDNA4) 上运行 Qwen3.8-27B 模型,使用来自 z-lab 的 DFlash2 块扩散 drafter: - 最高 227 tok/s 的代码性能 - HumanEval 平均 208 tok/s - 数学性能 133 tok/s 在现成的量化版本上,其 HumanEval 和 GSM8K 性能与 8-bit 参考版本相当。 而且这是无损的:贪心验证仅提交模型本身会产生的令牌,因此 drafter 改变了你获取答案的速度,但从不改变答案本身。 完整详情请参阅下文文章。
查看原文
查看缓存全文

缓存时间: 2026/08/27 17:56

很高兴宣布,Lucebox引擎现已在单块AMD Radeon AI PRO R9700(32GB,RDNA4)上支持Qwen3.8-27B模型,采用来自z-lab的DFlash2块扩散草稿验证技术:

  • 代码生成速度最高达227 token/s
  • HumanEval基准测试平均208 token/s
  • 数学推理速度达133 token/s

以上数据基于现成量化版本,该版本在HumanEval和GSM8K测试中表现与8位参考基准持平。

本方案完全无损:贪婪验证机制仅确认模型自身会生成的token,因此草稿技术仅改变答案获取速度,绝不影响答案内容。

完整技术解析请见下文。

相似文章