@ZyphraAI:Zyphra Research 发布 PUFFER,一种用于大规模语言模型数据集的新型增量模糊去重系统。PUFFER 运行……
摘要
Zyphra Research 发布 PUFFER,这是一种针对大规模语言模型数据集的增量模糊去重系统,完全在 CPU 上运行,比现有方法快 11-35 倍,已根据 Apache 2.0 协议开源。
查看缓存全文
缓存时间: 2026/09/02 13:57
Zyphra Research 发布 PUFFER:一种面向大语言模型规模数据集的新型增量式模糊去重系统。
该系统完全基于 CPU 运行,相比现有方法可实现 11-35 倍性能提升。
我们在内部训练数据集中已应用 PUFFER,并在 Apache 2.0 许可证下开源。https://t.co/I4XygVZkFi
相似文章
@Zai_org: https://x.com/Zai_org/status/2057216685040443743
本文介绍了ZCube,一种由Z.ai、Harnets.AI和清华大学提出的新型网络架构,用于解决Prefill-Decode分离式LLM推理集群中由拓扑引起的拥塞问题。在GLM-5.1编码工作负载的生产部署中,网络CapEx降低了33%,吞吐量提升了15%,TTFT P99延迟降低了40.6%。
大规模语言模型预训练中可扩展的频次与长度感知子文档去重
提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。
OpenZL
OpenZL 是一个压缩库,能够为特定数据格式生成专门的压缩器,以高速实现高压缩比,适用于数据中心工作负载,如 AI 处理。
@robertnishihara: 关于PD分离的一些直觉——PD不会加速预填充,实际上可能损害TTFT——PD的真正…
这篇来自Anyscale的博客文章解释了LLM服务中Prefill-Decode(PD)分离的直觉,展示了如何将预填充和解码阶段分配到专用GPU上,在使用Ray和vLLM的AMD MI325X上实现高达2.7倍的有效吞吐量提升和67%的成本节省,同时也讨论了PD分离何时没有帮助。
我逆向工程了 NPU 厂商的引擎格式(int8 权重存储为两个半字节平面)以运行 GGUF 而无需模型转换——现在比厂商自己的运行时快 1.5 倍
逆向工程了 Axera AX8850 NPU 的 int8 权重格式,以在 llama.cpp 中实现直接 GGUF 推理,在 Raspberry Pi 5 上实现了高达 24.5 t/s 的解码和 716 t/s 的预填充,性能比厂商的运行时高出 1.5 倍。