softmax

标签

Cards List
#softmax

雅可比引导噪声注入:提升大语言模型量化鲁棒性

arXiv cs.LG · 2026-08-24 缓存

本文提出雅可比引导噪声注入,一种通过向预注意力logits注入噪声来增强大语言模型量化鲁棒性的训练策略,噪声方差源自雅可比范数,在低比特量化设置中实现显著的性能增益。

0 人收藏 0 人点赞
#softmax

反思优化

Hacker News Top · 2026-06-26 缓存

一篇博客文章,讨论针对受约束的分类概率分布的优化技术,使用softmax重参数化和log barrier方法,应用于蛋白质结合剂设计。

0 人收藏 0 人点赞
#softmax

我弄清楚了‘超级权重’的成因

Reddit r/ArtificialInteligence · 2026-06-23

本文解释了大语言模型中的超级权重源于SoftMax与注意力机制的相互作用,该作用创建了一个充当稳定参考点的‘Nothing Dump’标记;移除这些权重会严重损害模型性能。

0 人收藏 0 人点赞
#softmax

@TheTuringPost: https://x.com/TheTuringPost/status/2068474648925216861

X AI KOLs Timeline · 2026-06-20 缓存

一篇关于知识蒸馏的教育性概述,涵盖其历史、核心概念(如softmax和温度)、类型、缩放定律以及包括DeepSeek-R1在内的实际示例。

0 人收藏 0 人点赞
#softmax

@reprompting: 使用共享内存归约的朴素CUDA softmax。归约似乎是一个非常直接的概念。

X AI KOLs Timeline · 2026-06-17 缓存

一条推文分享了一个使用共享内存归约的朴素CUDA softmax实现,并指出归约非常直接。

0 人收藏 0 人点赞
#softmax

FP8注意力中的P-Cast精度:凹陷引发的崩溃与S=2^8的最优性

arXiv cs.AI · 2026-06-08 缓存

本文分析了在将softmax输出转换为FP8(E4M3)时,由于注意力凹陷现象导致的FP8注意力精度损失。它表明正向KV迭代会导致非凹陷注意力值下溢,并提出反向迭代和静态缩放因子S=256来消除下溢,实现了3-10倍的MSE改进。

0 人收藏 0 人点赞
#softmax

当Softmax在顶部失败时:InfoNCE的极值校正

arXiv cs.LG · 2026-06-02 缓存

该论文指出了基于softmax的InfoNCE损失与现代对比学习中的归一化嵌入设置之间的不一致性。它提出了WEINCE,一种简单的修改,利用极值理论将softmax logits与端点短缺校正相结合,在视觉基准测试中取得了持续的改进。

0 人收藏 0 人点赞
#softmax

@zhaoran_wang: 对我来说,最酷的发现是你可以连接/插值所有 softmax/线性 变体,并给出一个有前途的方向……

X AI KOLs Timeline · 2026-05-30 缓存

讨论了这样一个发现:所有 softmax/线性注意力变体都可以被插值,并且 Muon 优化器对于 Parallax 超越 Softmax Attention 至关重要。包含论文和代码链接。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈