cuda-optimization

标签

Cards List
#cuda-optimization

NInfer 对 Qwen3.8-27B 的 Day-0 支持:约200 tok/s 生成速度,以及大量引擎改进

Reddit r/LocalLLaMA · 昨天

NInfer 新增对 Qwen3.8-27B 模型的 Day-0 支持,在单张 RTX 5090 上使用推测解码可实现约 200 tok/s 的生成速度,并包含并发请求和内核优化等引擎改进。

0 人收藏 0 人点赞
#cuda-optimization

@dair_ai:关于长时程智能体的杰出论文(建议收藏)——类似人类,如何让智能体在困难任务中坚持下去?

X AI KOLs Following · 2026-06-04 缓存

AutoLab 是一个新基准测试,针对 36 个由专家精心设计的长时程任务(系统优化、模型开发、CUDA 内核、谜题),对 17 个前沿模型进行评估。研究发现,决定成功的关键因素是持久性——而非初始尝试的质量。Claude-opus-4.6 在所有类别中名列前茅,而大多数其他模型要么过早终止,要么在几乎没有进展的情况下耗尽了预算。

0 人收藏 0 人点赞
#cuda-optimization

@modal: @vllm_project 和 @sgl_project 服务器在 Modal 上的新副本启动速度提升 3-10 倍。阅读文章了解具体实现方式 ——…

X AI KOLs Following · 2026-05-12 缓存

Modal 宣布,通过优化 GPU 健康管理和 CUDA 上下文检查点机制,vLLM 和 SGLang 服务器副本的启动速度提升了 3-10 倍。

0 人收藏 0 人点赞
#cuda-optimization

一个可定制的编译器,用于为AI模型生成高效的融合GPU内核 [P]

Reddit r/MachineLearning · 2026-05-11

作者介绍了一款用 Python 编写、高度可定制且易于修改的 ML 编译器。该编译器通过多级 IR 流水线将 LLMs 转换为优化的 CUDA 内核,在特定操作上实现了与 PyTorch 相当甚至更优的性能。文章详细阐述了该编译器的优化过程、降级规则以及用于生成高效融合 GPU 内核的 CLI 用法。

0 人收藏 0 人点赞
#cuda-optimization

RTX Pro 4500 Blackwell - Qwen 3.6 27B?

Reddit r/LocalLLaMA · 2026-05-09

一位开发者分享了在搭载 NVIDIA RTX Pro 4500 Blackwell 显卡的服务器上,使用 llama.cpp 运行 Qwen3.6-27B 模型的本地推理基准测试数据及 systemd 配置。该帖文征集了提升吞吐量的优化建议,并探讨了更大模型的潜在应用场景。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈