decoding

标签

Cards List
#decoding

基于注意力折扣的自适应采样器用于掩码扩散语言模型

arXiv cs.CL · 2026-06-10 缓存

本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。

0 人收藏 0 人点赞
#decoding

@TheAhmadOsman: LLM解码简化 来自X上即将发布的文章

X AI KOLs Timeline · 2026-06-06 缓存

Ahmad Osman预告了X上即将发布的一篇文章,该文章简化了LLM解码。

0 人收藏 0 人点赞
#decoding

# 支持性令牌揭示:用于快速扩散语言模型解码

arXiv cs.CL · 2026-06-04 缓存

本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。

0 人收藏 0 人点赞
#decoding

COFT:面向大型语言模型公平思维链推理的反事实-共形解码

arXiv cs.CL · 2026-06-01 缓存

COFT是一种无需训练的解码方法,通过应用令牌级公平控制和共形校准来减少大型语言模型思维链推理中的偏见,以最小的计算开销实现30-55%的偏见降低。

0 人收藏 0 人点赞
#decoding

探究提示KV缓存:何处变得可舍弃

arXiv cs.CL · 2026-06-01 缓存

本文系统性地探究了在LLM解码过程中,何时以及提示KV缓存的哪些部分变得可舍弃,表明冗余主要涉及聊天模板脚手架而非任务内容,并且用中性填充内容进行替换可保持准确性。

0 人收藏 0 人点赞
#decoding

@grapeot: LLM 推理系统到底是怎么跑的?SGLang Omni 团队最近公开了一篇很少见的文章——把一个顶级推理系统团队的完整决策链路摊在明面上。我顺着原文梳理了一篇科普,从自回归decode、KV cache、continuous batchi…

X AI KOLs Timeline · 2026-05-30

本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。

0 人收藏 0 人点赞
#decoding

思考先于约束:面向大型语言模型的统一解码框架

Hugging Face Daily Papers · 2026-05-28 缓存

提出了一种名为 In-Writing 的新型混合解码框架,该框架在触发词之后才施加约束,将自由形式推理与结构化生成相结合,从而在分类和推理任务中提升准确性。

0 人收藏 0 人点赞
#decoding

当信心误导:面向扩散语言模型的后缀锚定与锚邻域置信度调制

Hugging Face Daily Papers · 2026-05-27 缓存

研究人员提出一种名为“后缀锚定置信度调制”的无训练方法,通过解决EOT标记和过早解码的问题,改进扩散语言模型中基于置信度的解码。

0 人收藏 0 人点赞
#decoding

@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...

X AI KOLs Timeline · 2026-05-26 缓存

NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。

0 人收藏 0 人点赞
#decoding

@davideciffa: 如果你拥有Nvidia RTX 4090,--ddtree-budget 36是最佳配置,可在解码过程中带来2.5倍速度提升…

X AI KOLs Timeline · 2026-05-24 缓存

一条推文推荐Nvidia RTX 4090使用--ddtree-budget 36,声称在Qwen3.6_27B解码时实现2.5倍加速。

0 人收藏 0 人点赞
#decoding

通过协作逐步多教师解码蒸馏长链思维推理

Hugging Face Daily Papers · 2026-05-04 缓存

CoRD是一个协作多教师解码框架,通过预测困惑度评分和束搜索合成推理轨迹,实现了大型推理模型的高效蒸馏,具有高质量输出和泛化性能。

0 人收藏 0 人点赞
#decoding

No-Worse Context-Aware Decoding:在上下文条件生成中防止中性退化

arXiv cs.CL · 2026-04-21 缓存

本文提出了一种名为 NWCAD(No-Worse Context-Aware Decoding)的解码阶段适配器。该方法旨在防止“中性退化”问题,即大语言模型(LLM)在处理无信息量上下文时,错误覆盖原有正确答案。NWCAD 采用双流架构设计,并通过门控机制实现对无上下文解码的安全回退。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈