标签
中国企业越来越多地将AI加速器预算分配给华为和Hygon等国内供应商,在中美紧张局势下减少对英伟达的依赖。彭博社一项调查显示,未来一年内46%的支出将用于国内产品,高于之前的30%。
John Carmack 评论了关于AI加速器的内存成本和容量问题,指出模型推理可以有确定性的内存访问模式,这与游戏渲染形成对比。
QuixiAI 发布了 QuixiCore,这是一系列面向现代加速器的原生高性能 AI 内核库,为 CUDA、Metal、ROCm、XPU 和 Gaudi 后端提供了独立的实现,所有实现共享一个通用契约但没有共享代码。
至少有七家中国公司正在出货H100/H200级别的AI加速器,多数近期上市,部分由前NVIDIA/AMD架构师创立。华为昇腾950瞄准H200级别性能,中国本土市场份额随着NVIDIA份额下降而上升。
用户询问在中国购买用于推理的国产AI加速器/GPU,特别是寻找华为替代英伟达的产品,并希望支持vLLM或Llama.cpp。
KForge是一个跨平台框架,利用两个协作的基于LLM的智能体,自动生成和优化适用于多种AI加速器的高性能计算内核,在NVIDIA B200和Intel Arc B580硬件上实现了显著的加速效果。
本文介绍了 TRAM,一种联合优化近似乘法器结构和 AI 模型参数的方法,旨在降低 AI 加速器的功耗,同时保持模型精度。
AccelOpt是一种自我改进的LLM智能体系统,通过迭代生成和优化记忆自主优化AI加速器内核,在AWS Trainium上实现了49%至61%的峰值吞吐量提升,同时比Claude Sonnet 4便宜26倍。