标签
本文深入解读NVIDIA最新发布的《AI Model Co-Design》文章,指出在AI推理场景中,存储(内存带宽、权重读取)已取代GPU算力成为主要瓶颈,并阐述了TensorRT-LLM和Blackwell架构围绕Roofline模型的设计策略,强调减少数据移动比提升计算能力更为关键。
Flash-KMeans是精确KMeans的一种I/O感知实现,它围绕现代GPU瓶颈重新设计了算法,通过消除冗余的内存读写,相比cuML实现了33倍加速,相比FAISS实现了200倍加速。
XCENA,一家由三星和SK海力士资深人士创立的芯片初创公司,融资1.35亿美元,用于开发一种以内存为核心的芯片,该芯片可在DRAM附近处理AI推理任务,从而减少CPU与GPU之间昂贵的数据传输。该公司的MX1芯片有望提高效率并降低基础设施成本。
这是一个热门观点,认为上下文窗口分散了对AI记忆真正问题的注意力,这个问题仍未解决,并导致忘记上下文和重复错误信息。