llm-inference

标签

Cards List
#llm-inference

Lifecycle-Optimal Tokenization: Vocabulary Size as a Deployment-Regime-Dependent Infrastructure Parameter

arXiv cs.LG · 14小时前 缓存

This paper argues that the optimal tokenizer vocabulary size is not fixed but depends on the deployment regime, such as batch size and inference volume. Through roofline analysis and experiments on A10G and A100 GPUs, it shows the lifecycle-optimal vocabulary can shift by up to 16x between on-device and datacenter serving, with minimal quality impact.

0 人收藏 0 人点赞
#llm-inference

LinearKV: One Cached State Suffices for Position-Independent Caching in Hybrid LLMs

arXiv cs.AI · 14小时前 缓存

LinearKV is a training-free framework that enables position-independent caching for hybrid LLMs by using a single cached state to initialize linear layers, outperforming exact prefix-state composition and remaining compatible with existing PIC methods.

0 人收藏 0 人点赞
#llm-inference

SPECTRA: Pushing the KV Cache Beyond the 2-Bit Cliff via Spectral Transform Coding

arXiv cs.LG · 2天前 缓存

SPECTRA is a training-free codec that re-encodes LLM KV caches via spectral transform to concentrate bit budgets on important channels, achieving near-lossless 4x compression and usable compression up to 12x, surpassing the 2-bit quantization cliff.

0 人收藏 0 人点赞
#llm-inference

CommitKV:通过提交转换实现的多轮智能体生命周期感知KV缓存压缩

arXiv cs.LG · 2天前 缓存

CommitKV提出了一种面向多轮ReAct智能体的生命周期感知KV缓存压缩方法,通过提交转换区分休眠令牌与已完成令牌,以减少内存使用并加速推理。

0 人收藏 0 人点赞
#llm-inference

我将 Qwen3.6 27B 的 GGUF 量化与 NVFP4、AWQ、AutoRound 和 FP8 进行了对比

Reddit r/LocalLLaMA · 3天前

一项详细基准测试,比较了 Qwen3.6 27B 在 GGUF、NVFP4、AWQ、AutoRound 和 FP8 格式下的 16 种量化,测量与未量化参考的 KL 散度。纯权重的 GGUF 量化通常在质量-大小权衡上表现最佳,而 vLLM 量化则差异显著。

0 人收藏 0 人点赞
#llm-inference

@no_stp_on_snek: Muse Glimmer 提醒——如果你正在测试 Meta 的 Muse Glimmer,在公开发布数据之前有两个服务配置陷阱值得了解…

X AI KOLs Timeline · 3天前 缓存

关于 Meta Muse Glimmer 的提醒:通过系统提示设置推理强度会被聊天模板的高默认值部分覆盖,而缺省默认值是高,不是关闭。使用 chat_template_kwargs.reasoning_strength 能提供更多控制。

0 人收藏 0 人点赞
#llm-inference

为什么推测解码在2026年走向成熟?

Reddit r/LocalLLaMA · 3天前

讨论了为什么推测解码在2026年对LLM推理而言走向成熟,引用了Uber的早期使用、Apple和DeepMind的论文以及Tri Dao的研究,并观察了其在框架和本地部署中的采用情况。

0 人收藏 0 人点赞
#llm-inference

Autonomy-of-Heads: Data-Free Sparse Attention from Frozen Query-Key Geometry

arXiv cs.CL · 3天前 缓存

AoH is a data-free method that identifies retrieval and streaming heads from the spectral geometry of query-key projections, enabling sparse attention without runtime attention scores. At 50% sparsity it retains 96.5% of full-attention performance while reducing prefill/decode latency and KV-cache memory.

0 人收藏 0 人点赞
#llm-inference

CubicQuant:面向1-8位权重高吞吐量LLM推理的参数化非均匀码本

arXiv cs.LG · 3天前 缓存

CubicQuant提出了一种用于LLM权重的参数化非均匀标量量化格式,利用单调三次曲线在1-8位宽度下自适应重建水平,同时保留密集整数码流以提升GPU执行效率。实验表明,与均匀基线和浮点基线相比,RMSE有所降低,并给出了初步的H200内核测量结果。

0 人收藏 0 人点赞
#llm-inference

基于混合分析与机器学习预测器的大语言模型推理延迟与能耗多级建模

arXiv cs.LG · 3天前 缓存

本文介绍了HYMELL,一种混合分析与机器学习框架,用于估算LLM在预填充(prefill)和解码(decode)阶段的推理延迟与能耗,并在NVIDIA H100上进行了验证,对LLaMA 3 8B的误差低于5%。

0 人收藏 0 人点赞
#llm-inference

打造预算型 32GB → 48GB 显存家用 AI 服务器:2-3 张 RX 9060 XT 16GB 对比 RTX 5060 Ti 16GB,AM5 还是二手 EPYC?

Reddit r/LocalLLaMA · 4天前

一位用户正在寻求构建预算型家用 AI 服务器(32-48GB 显存)的建议,正在 AMD RX 9060 XT 和 Nvidia RTX 5060 Ti GPU 之间犹豫,并纠结于使用 AM5 还是二手 EPYC 平台来进行本地 LLM 推理和大型 MoE 模型卸载。

0 人收藏 0 人点赞
#llm-inference

OasisKV:利用前瞻稀疏预取将解码中KV缓存扩展到HBM之外

Hugging Face Daily Papers · 5天前 缓存

OasisKV是一个以内存为中心的LLM推理系统,通过使用来自推测解码的前瞻令牌预取稀疏且重要的KV块,将完整KV缓存存储与HBM解耦,与密集vLLM相比实现了高达2.1倍的吞吐量提升,且精度损失极小。

0 人收藏 0 人点赞
#llm-inference

DBLAST:用于随机投机解码的依赖块草拟

arXiv cs.CL · 6天前 缓存

该预印本介绍了DBLast,一种用于随机投机解码的依赖块草拟器,它利用基于标记位置的低秩潜在混合模型以及面向接受的训练目标,在更高熵解码场景中提高接受草稿长度。基于Qwen3-4B和Qwen3-8B的实验表明,与独立块采样相比,该方法能持续提升接受长度。

0 人收藏 0 人点赞
#llm-inference

QEvict: Recoverable Quantized KV Eviction for Attention-Drift-Robust Long-Context Decoding

arXiv cs.LG · 6天前 缓存

This paper introduces QEvict, a KV-cache management scheme for LLMs that uses recoverable quantized eviction to handle attention drift during long-context decoding, improving memory efficiency while preserving important historical context.

0 人收藏 0 人点赞
#llm-inference

@CycleDecoded: 别再用原生 HuggingFace硬扛本地大模型推理了,显存直接爆满,吞吐量慢得像乌龟爬! 伯克利实验室出品的 vLLM,用搞操作系统内存分页(PagedAttention)的那套黑科技,直接把 GPU 显存压榨到了极限,KV Cache…

X AI KOLs Timeline · 6天前 缓存

伯克利 Sky Computing Lab 开源的 vLLM 是一个高性能 LLM 推理与服务库,通过 PagedAttention 和连续批处理大幅提升吞吐量、降低显存浪费,并兼容 OpenAI API 和多种硬件。

0 人收藏 0 人点赞
#llm-inference

)

TLDR AI · 6天前 缓存

DeepSeek 宣布大幅上调 API 价格,分析认为此举不仅是 GPU 成本转嫁,更反映了市场向基于价值的定价转变以及开源生态系统带来的压力。

0 人收藏 0 人点赞
#llm-inference

深入vLLM:高吞吐量LLM推理系统剖析(2025)

Hacker News Top · 6天前 缓存

深入探讨vLLM用于高吞吐量LLM推理的架构与组件,涵盖调度、分页注意力、连续批处理、高级特性、扩展、服务及基准测试。

0 人收藏 0 人点赞
#llm-inference

基于二值主成分的无训练哈希注意力

arXiv cs.LG · 2026-08-06 缓存

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

0 人收藏 0 人点赞
#llm-inference

在查询关注之处分配比特:具有注意力保持变换的KV缓存向量量化

arXiv cs.LG · 2026-08-06 缓存

本文提出NOVA-KV,一种用于KV缓存量化的变换编码方法,它利用注意力保持变换在查询实际关注的位置分配比特,与先前方法相比,在低比特率下提高了长上下文检索精度。

0 人收藏 0 人点赞
#llm-inference

Agentic AI 工作流的架构影响

arXiv cs.AI · 2026-08-06 缓存

本文首次对智能体 AI 工作流进行架构特征分析,揭示了碎片化、异构化的执行模式与常规服务器设计不匹配的问题,并介绍了一个名为 Agora 的原型服务器以提高 CPU/GPU 利用率和吞吐量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈