triton-kernels

标签

Cards List
#triton-kernels

具有对数线性复杂度的块稀疏注意力机制

Hugging Face Daily Papers ↗ · 2026-09-25 缓存

本文提出了PISA,一种块稀疏注意力机制,采用金字塔Top-K选择策略以实现O(N log N)复杂度,提升长上下文语言模型的效率,在基准测试中性能相当,在检索任务上表现更优。

0 人收藏 0 人点赞
#triton-kernels

@PyTorch: AMD has been upstreaming optimizations for improved FP8 training support in PyTorch/TorchTitan and PyTorch/TorchAO, mak…

X AI KOLs Timeline ↗ · 2026-08-13 缓存

AMD upstreamed optimizations to PyTorch/TorchTitan and TorchAO for FP8 training on AMD Instinct GPUs, achieving up to 13.4% throughput gains on Llama3-8B and recovering 89% of FP8 quantization overhead on DeepSeek-V3 via fused Triton kernels.

0 人收藏 0 人点赞
#triton-kernels

我发布了一个在GPT-2中等规模(约3.54亿参数,115亿token)的无softmax注意力模型:结构稀疏性+瓦片跳过内核实现长上下文显存节省。开放权重+自定义Triton内核[R]

Reddit r/MachineLearning ↗ · 2026-06-21 缓存

发布了RRT-355M,一个GPT-2中等规模的无softmax注意力模型,拥有3.54亿参数,从零开始在115亿token上训练,利用结构稀疏性和瓦片跳过内核实现长上下文效率,在22个任务基准测试中达到与GPT-2中等规模相当的性能。

0 人收藏 0 人点赞
#triton-kernels

@raphaelsrty:在GPU上计算最大相似度(ColBERT、ColPali的评分步骤)可以被优化,这正是@tonywu_71所做的。我……

X AI KOLs Following ↗ · 2026-06-10 缓存

Tony Wu发布了late-interaction-kernels (LIK):用于MaxSim的融合Triton内核,MaxSim是ColBERT和ColPali背后的评分步骤,已集成到PyLate和colpali-engine中,提供了内存效率和性能提升。

0 人收藏 0 人点赞
#triton-kernels

Wall Attention(GitHub 仓库)

TLDR AI ↗ · 2026-06-03 缓存

Wall Attention 是一种新的注意力变体,具有每个通道、每个时间步的乘法衰减,提供内容相关的遗忘率,以及在Triton中实现的高效训练/解码内核。

0 人收藏 0 人点赞
#triton-kernels

@akshay_pachaar:PyTorch Autograd 与 Unsloth Triton 内核对比。UnslothAI 背后的核心工程一直令人印象深刻!它并未……

X AI KOLs Following ↗ · 2026-04-20 缓存

技术解析:对比 PyTorch 默认的 autograd 与 UnslothAI 使用 OpenAI Triton 语言编写的自定义反向传播内核,以实现更高效的 LLM 微调。

0 人收藏 0 人点赞
#triton-kernels

单GPU微调的高效异构协同设计

Papers with Code Trending ↗ · 2026-03-17 缓存

SlideFormer 提出了一种异构协同设计,用于在单GPU上进行全参数LLM微调,利用GPU/CPU/RAM/NVMe及其层滑动引擎和优化的Triton内核,在单张RTX 4090上实现对123B+模型的微调,吞吐量显著提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈