decoding

标签

Cards List
#decoding

FADE:通过减少语言先验主导性来缓解大型视觉语言模型中的幻觉

arXiv cs.AI · 2026-06-30 缓存

本文提出FADE,一种无需训练的方法,通过削弱关键层的FFN输出来减少语言先验主导性,从而缓解大型视觉语言模型中的幻觉,并在多个基准测试中证明了有效性。

0 人收藏 0 人点赞
#decoding

掩码扩散解码作为$x$-预测流

arXiv cs.CL · 2026-06-30 缓存

本文重新将掩码扩散语言模型解码解释为连续干净状态预测,引入了一个基于流的框架,其中令牌根据置信度连续异步更新,在仅使用25%的解码预算下,达到了LLaDA性能的97%。

0 人收藏 0 人点赞
#decoding

多块扩散语言模型

Hugging Face Daily Papers · 2026-06-30 缓存

本文提出多块扩散语言模型(MBD-LMs),将单块扩散扩展为并发多块解码,并采用优化训练策略如多块教师强制(Multi-block Teacher Forcing)和优化的块缓冲区解码算法。实验表明,每次前向传递的令牌数增加,基准测试准确率提升。

0 人收藏 0 人点赞
#decoding

@divaagurlxw: 如果我想让LLM响应低于一秒,我会研究的推理优化方法:1.KV-Caching 2.Speculative Decoding 3.FlashAtte…

X AI KOLs Timeline · 2026-06-29 缓存

一条推文列出了16种推理优化技术,用于实现低于一秒的LLM响应,包括KV缓存、推测解码、FlashAttention和各种并行化方法。

0 人收藏 0 人点赞
#decoding

Speculative Refinement: 一种混合自回归扩散解码策略及其在不同基准测试中的行为表现

arXiv cs.AI · 2026-06-29 缓存

介绍了 Speculative Refinement (SpecRef),一种无需训练的混合解码策略,它通过熵引导的选择性掩码,从自回归草稿中热启动掩码扩散语言模型。在六个基准测试上的评估表明,代码基准测试混淆了结构发现与逻辑正确性,识别出了一种精炼张力现象,并显示评估协议可能产生不同的模型排名。

0 人收藏 0 人点赞
#decoding

huff12 - 一个适用于Apple Silicon的12流Huffman解码器

Lobsters Hottest · 2026-06-28

huff12是一个针对Apple Silicon处理器优化的12流Huffman解码器,旨在通过并行流处理来提高解码性能。

0 人收藏 0 人点赞
#decoding

@TheAhmadOsman: 学习LLM中的解码和采样器机制能带来很多隐藏的阿尔法收益

X AI KOLs Following · 2026-06-20 缓存

一条推文强调了理解LLM中解码和采样器机制对于获得优势的价值。

0 人收藏 0 人点赞
#decoding

现在谁主导解码?追踪 Masked Diffusion Language Models 集成中的可靠轨迹

Hugging Face Daily Papers · 2026-06-15 缓存

本文提出 TIE,一种面向 Masked Diffusion Language Models 的知识融合框架,通过追踪置信度动态来识别可靠解码轨迹,并在模型间迭代传输部分去噪序列,从而提升推理任务的生成质量。

0 人收藏 0 人点赞
#decoding

@davideciffa:非常自豪地宣布,我们刚刚发布了 Luce KVFlash。在 Lucebox 中以 256k 上下文运行您偏好的模型,无需…

X AI KOLs Timeline · 2026-06-14 缓存

宣布发布 Luce KVFlash,这是一个在 Lucebox 中以 256k 上下文运行模型的工具,无需担心 KVCache 和 OOM,通过推测预填充和动态卸载,在长上下文场景下解码速度提升高达 2.9 倍。

0 人收藏 0 人点赞
#decoding

LatticeBridge:稀有事件序列推断实现忠实结构化序列生成

arXiv cs.CL · 2026-06-11 缓存

LatticeBridge 提出了一种扭曲序贯蒙特卡洛解码器用于结构化序列生成,通过将问题视为稀有事件推断来提升约束满足,在CommonGen、E2E NLG和WikiBio上优于贪心搜索和束搜索基线。

0 人收藏 0 人点赞
#decoding

基于注意力折扣的自适应采样器用于掩码扩散语言模型

arXiv cs.CL · 2026-06-10 缓存

本文介绍了ADAS,一种无需训练的重排序规则,用于并行掩码扩散解码。它利用注意力对强烈关注不确定位置的token进行折扣,从而在低NFE设置下提升推理和代码任务的性能,且运行时开销极小。

0 人收藏 0 人点赞
#decoding

@TheAhmadOsman: LLM解码简化 来自X上即将发布的文章

X AI KOLs Timeline · 2026-06-06 缓存

Ahmad Osman预告了X上即将发布的一篇文章,该文章简化了LLM解码。

0 人收藏 0 人点赞
#decoding

# 支持性令牌揭示:用于快速扩散语言模型解码

arXiv cs.CL · 2026-06-04 缓存

本文提出了 AXON,一种无需训练的模块,通过智能选择"锚点"(anchor)token 优先揭示,并利用注意力、不确定性和置信度信号来辅助后续去噪步骤,从而改善离散扩散语言模型解码的质量-延迟权衡。在推理和代码生成基准测试上的实验表明,AXON 在保持或提升准确率的同时减少了函数评估次数。

0 人收藏 0 人点赞
#decoding

COFT:面向大型语言模型公平思维链推理的反事实-共形解码

arXiv cs.CL · 2026-06-01 缓存

COFT是一种无需训练的解码方法,通过应用令牌级公平控制和共形校准来减少大型语言模型思维链推理中的偏见,以最小的计算开销实现30-55%的偏见降低。

0 人收藏 0 人点赞
#decoding

探究提示KV缓存:何处变得可舍弃

arXiv cs.CL · 2026-06-01 缓存

本文系统性地探究了在LLM解码过程中,何时以及提示KV缓存的哪些部分变得可舍弃,表明冗余主要涉及聊天模板脚手架而非任务内容,并且用中性填充内容进行替换可保持准确性。

0 人收藏 0 人点赞
#decoding

@grapeot: LLM 推理系统到底是怎么跑的?SGLang Omni 团队最近公开了一篇很少见的文章——把一个顶级推理系统团队的完整决策链路摊在明面上。我顺着原文梳理了一篇科普,从自回归decode、KV cache、continuous batchi…

X AI KOLs Timeline · 2026-05-30

本文基于SGLang Omni团队的内部决策文章,从自回归解码、KV缓存、连续批处理等基础概念出发,深入浅出地介绍了LLM推理系统的运作原理。

0 人收藏 0 人点赞
#decoding

思考先于约束:面向大型语言模型的统一解码框架

Hugging Face Daily Papers · 2026-05-28 缓存

提出了一种名为 In-Writing 的新型混合解码框架,该框架在触发词之后才施加约束,将自由形式推理与结构化生成相结合,从而在分类和推理任务中提升准确性。

0 人收藏 0 人点赞
#decoding

当信心误导:面向扩散语言模型的后缀锚定与锚邻域置信度调制

Hugging Face Daily Papers · 2026-05-27 缓存

研究人员提出一种名为“后缀锚定置信度调制”的无训练方法,通过解决EOT标记和过早解码的问题,改进扩散语言模型中基于置信度的解码。

0 人收藏 0 人点赞
#decoding

@xuanchi13: 潜在vs像素的争论没有抓住要点。GPT Image 2 展示了用户注意到的:像素级保真度。潜在模型...

X AI KOLs Timeline · 2026-05-26 缓存

NVIDIA 推出了 PiD,一种 Pixel Diffusion Decoder,用其替换潜在扩散模型中的传统 VAE/RAE 解码器,实现快速高分辨率解码,速度提升高达 6 倍,并改进了视觉保真度。

0 人收藏 0 人点赞
#decoding

@davideciffa: 如果你拥有Nvidia RTX 4090,--ddtree-budget 36是最佳配置,可在解码过程中带来2.5倍速度提升…

X AI KOLs Timeline · 2026-05-24 缓存

一条推文推荐Nvidia RTX 4090使用--ddtree-budget 36,声称在Qwen3.6_27B解码时实现2.5倍加速。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈