laya.cpp: 优化的Laya近即时决策

Reddit r/LocalLLaMA 工具

摘要

laya.cpp 是一个优化的 C++ 实现,用于近即时决策,基于 ggml 构建并带有自定义 CUDA 内核,展示了在 Laya 模型上相比 Python 的显著速度提升。

在看到 u/Nandakishor_ml 介绍 Laya 的帖子后,我想看看它在独立 C++ 实现中能运行多快。感谢 u/Nandakishor_ml 在架构、训练和开源发布方面的贡献。我的贡献是推理实现:laya.cpp,基于 ggml 构建并带有自定义 CUDA 内核。它支持所有三个检查点——英语、多语言和类型化决策——具有原生分词、模型执行和输出格式化。还有一个带有 JEV 兼容端点的 HTTP 服务器。推理不需要 Python 或 PyTorch。在 RTX PRO 6000 Blackwell(功耗上限 450 W)上的一些英语模型结果: 批次 Python BF16 C++ BF16 Python FP32 C++ FP32 1 149 366 148 342 2 268 586 202 421 4 460 761 233 437 8 663 810 232 386 这些是每秒问题数,基于包含选择、分数和布尔值的固定 250 问题语料库。每种精度都有配对的 Python/C++ 时间,执行顺序交替。不包括加载和 JSON 传输。README 中有完整的三模型结果。大部分优化来自移除不必要的转换和复制、融合操作同时保留舍入,以及改进注意力内存访问。代码采用 MIT 许可证。BF16 目前需要文档中所述的 CUDA 13.0/cuBLAS 13.1.0 构建配置。使用 Codex Astra 实现。
查看原文

相似文章

convaiinnovations/laya

Hugging Face Models Trending

Laya 是一款开源的非自回归决策模型,提供带有校准概率的类型化回答,旨在用于电子邮件分类和对话AI等任务,相比现有模型显示出显著的性能提升。

Laya: Jev 的开源版本

Hacker News Top

Laya 是一个开源的快速多语言决策引擎,为结构化模式提供非自回归、校准概率,声称比 Jev 快 6-8 倍,并且完全开放。