hardware-aware

标签

Cards List
#hardware-aware

计算最优并非集群最优:面向稀疏专家混合模型的系统感知扩展

arXiv cs.LG · 2026-08-12 缓存

本文介绍了MOSAIC,一个联合优化稀疏专家混合模型架构与硬件系统以支持大规模预训练的框架,表明在考虑MFU、通信成本和并行布局时,计算最优的稀疏性并不一定是集群最优的。

0 人收藏 0 人点赞
#hardware-aware

重新思考小型VLM量化:从组件分析到硬件感知的边缘部署

arXiv cs.LG · 2026-07-10 缓存

本文系统性地评估了Jetson边缘设备上小型视觉语言模型的组件级量化,发现模型架构(MoE vs 稠密)显著影响量化敏感性,且量化误差在大体上是累加的,除了模态对齐路径之外。

0 人收藏 0 人点赞
#hardware-aware

Hawk:利用硬件感知知识实现高性能NPU内核生成

arXiv cs.AI · 2026-07-03 缓存

Hawk是一个无需训练的框架,通过利用硬件感知知识来提升大语言模型在NPU内核生成上的表现,将生成准确率从49.4%提升至80.0%,并相比当前最优基线实现最高2.2倍的执行加速。

0 人收藏 0 人点赞
#hardware-aware

Gram Newton-Schulz:一种用于Muon的快速、硬件感知的牛顿-舒尔茨算法

Hacker News Top · 2026-06-09 缓存

本文介绍了Gram Newton-Schulz,这是对Muon优化器中使用的牛顿-舒尔茨正交化过程的一种硬件感知优化,能够在保持模型质量的同时显著加速大型语言模型的训练。

0 人收藏 0 人点赞
#hardware-aware

AutoMCU:基于LLM的多智能体系统的可行性优先MCU神经网络定制

arXiv cs.LG · 2026-05-22 缓存

AutoMCU是一个利用LLM的多智能体系统,可自动为微控制器单元设计神经网络,在确保硬件约束可行性的同时显著缩短定制时间。

0 人收藏 0 人点赞
#hardware-aware

@AYi_AInotes: 做LLM生产落地的开发老哥们,可以看Andrew Ng刚出的这门课,免费版可以看所有视频和基础代码。 这个课程不是又一遍Attention is All You Need的数学推导, 也不是又一套调prompt的玄学技巧, 更不是又一个从…

X AI KOLs Timeline · 2026-05-14

Andrew Ng 推出了一门新的 LLM 生产落地课程,免费版可观看所有视频和基础代码。课程深入讲解 LLM 内部机制、推理优化(如量化、KV Cache、Flash Attention、投机解码)以及硬件感知优化,由 AMD 工程副总裁主讲,旨在帮助开发者将 Transformer 从学术概念转化为可调试、可优化的工程工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈