Forge-UGC:面向通用图编译器的 FX 优化与寄存器图引擎
摘要
Forge-UGC 是一个四阶段通用图编译器,可在 NPU 上加速 Transformer 部署,相比 OpenVINO/ONNX Runtime,编译时间缩短 6.9–9.2 倍,推理延迟降低 18–36%,能耗减少 30–41%。
查看缓存全文
缓存时间: 2026/04/21 15:38
论文页面 - Forge-UGC:面向通用图编译的 FX 优化与寄存器图引擎
来源:https://huggingface.co/papers/2604.16498
摘要
Forge-UGC 是一个四阶段编译器,可在异构硬件上高效部署 Transformer,与现有框架相比,编译速度更快、推理延迟更低、能耗更少。
我们提出 Forge-UGC(FX Optimization and Register-Graph Engine for Universal Graph Compilation),一个面向异构加速器硬件(已在 Intel AI Boost NPU 验证)的 Transformer 部署四阶段编译器。现有框架如 OpenVINO 与 ONNX Runtime 常采用不透明编译管线,Pass 级可见性有限且缓冲区管理薄弱,导致编译开销与运行时开销偏高。Forge-UGC 采用硬件无关设计,将图捕获、优化、中间表示下沉与后端调度四阶段解耦:
- 阶段 1 在 ATen 算子级使用 torch.export 捕获计算图,原生支持现代 Transformer 组件(旋转位置编码、分组查询注意力、SwiGLU),无需手工分解。
- 阶段 2 执行六种优化 Pass:死代码消除、公共子表达式消除、常量折叠、注意力融合、算子融合与布局优化,图节点数减少 14.2%–21.9%。
- 阶段 3 将优化后的图下沉至带显式虚拟寄存器分配的强类型中间表示。
- 阶段 4 进行活跃变量分析、线性扫描缓冲区分配(峰值缓冲区数降低 30%–48%)与设备亲和调度(NPU-CPU 切换减少 42%–65%)。
在 WikiText-103 与 GLUE 上,对 125 M–8 B 参数的六大模型家族评估显示,Forge-UGC 编译速度比 OpenVINO 与 ONNX Runtime 快 6.9–9.2 倍,推理延迟降低 18.2%–35.7%,单次推理能耗减少 30.2%–40.9%。精度无损,最大绝对 logit 差低于 2.1e-5,KL 散度低于 8.4e-9。我们还提出融合增益比、编译效率指数与逐 Pass 执行分析,用于系统评估 NPU 编译管线。
查看 arXiv 页面 (https://arxiv.org/abs/2604.16498)
查看 PDF (https://arxiv.org/pdf/2604.16498)
添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2604.16498)
在智能体中获取该论文:
hf papers read 2604.16498
尚未安装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型引用该论文
在模型 README.md 中引用 arxiv.org/abs/2604.16498 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集引用该论文
在数据集 README.md 中引用 arxiv.org/abs/2604.16498 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 引用该论文
在 Space README.md 中引用 arxiv.org/abs/2604.16498 即可在此页面显示链接。
包含该论文的合集 0
暂集合辑包含该论文
将该论文添加到合集 (https://huggingface.co/new-collection) 即可在此页面显示链接。
相似文章
Kernel Forge:一个基于LLM的CUDA内核生成与优化智能体框架
Kernel Forge是一个开源智能体框架,利用大语言模型和蒙特卡洛树搜索,为任何未经修改的PyTorch模型自动生成并优化CUDA内核,在Gemma 4 E2B的softmax上实现了高达2.83倍的加速。
我逆向工程了 NPU 厂商的引擎格式(int8 权重存储为两个半字节平面)以运行 GGUF 而无需模型转换——现在比厂商自己的运行时快 1.5 倍
逆向工程了 Axera AX8850 NPU 的 int8 权重格式,以在 llama.cpp 中实现直接 GGUF 推理,在 Raspberry Pi 5 上实现了高达 24.5 t/s 的解码和 716 t/s 的预填充,性能比厂商的运行时高出 1.5 倍。
基准测试:仅限CPU硬件上Parakeet TDT 0.6B的ONNX Runtime、HF Transformers与GGUF对比 [D]
一项针对仅CPU硬件上Parakeet TDT 0.6B ASR模型的ONNX Runtime、HF Transformers与GGUF的基准测试显示,ONNX Runtime的推理速度比HF Transformers bfloat16快37%,而GGUF则优先考虑内存效率。
KForge:面向AI加速器的LLM驱动跨平台内核生成
KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。
transformers 原生支持 GGUF 格式!
Hugging Face 宣布在 transformers 库中原生支持 GGUF 文件,使得量化模型能更轻松地与 PyTorch 工具结合使用,性能与 llama.cpp 相当。