@_akhaliq: GPU Forecasters 语言模型作为内核运行时优化的选择性代理
摘要
本文提出使用语言模型作为选择性代理来优化GPU内核运行时,展示了一种新颖的性能预测方法。
GPU Forecasters
语言模型作为内核运行时优化的选择性代理 https://t.co/s2r0lFWz9r
查看缓存全文
缓存时间: 2026/06/02 19:38
GPU预测器
语言模型作为内核运行时优化的选择性替代方案 https://t.co/s2r0lFWz9r
相似文章
@akshay_pachaar: https://x.com/akshay_pachaar/status/2094490705024676272
这篇文章解释了用于在GPU上服务大型语言模型的静态、动态和连续批处理策略,详细说明了它们的权衡以及如何优化吞吐量和减少空闲时间。
@levidiamode: GPU编程的第163/365天 - 今天看几个不同的agentic GPU内核优化系统。我最感兴趣的两个是…
一条推文讨论了两种agentic GPU内核优化系统:@dogacel0的Auto GPU Kernel和@songhan_mit实验室的Kernel Design Agents,两者均在MLSys Sparse Attention FlashInfer比赛中获胜。该帖子突出了使用子代理和Claude技能进行GPU编程的不同方法。
面向AMD GPU的更好HIP内核生成:合成数据、多智能体搜索与强化学习
探讨了合成数据生成、多智能体优化和强化学习,以提高语言模型为AMD GPU生成高性能HIP内核的能力,并在MI350X上展示了编译率和正确率的提升。
@akshay_pachaar: https://x.com/akshay_pachaar/status/2084992645966016757
一份技术指南,演示如何使用开源工具在单个 GPU 上部署五个专用的小型模型(SLM、OCR、NER、重排序器、目标检测器),涵盖内存管理、批处理以及 Superlinked Inference Engine。
优化模型以快速进行代码生成(8分钟阅读)
Morph LLC描述了三种关键技术——基于编码输出训练投机模型、在廉价GPU上自动搜索内核、以及编写自定义互连——以大幅加速像Qwen和DeepSeek这样的开放模型在编码代理工作负载上的运行,实现了最高3倍的投机解码加速,并在7000美元的GPU上达到97-162 tok/s。