training-free

标签

Cards List
#training-free

Archer: Adaptive Reuse of Cached Hidden States for Efficient Rollback in Diffusion Language Models

arXiv cs.CL · 昨天 缓存

Introduces Archer, a training-free KV caching method for diffusion language models that adaptively reuses cached hidden states to reduce recomputation while preserving rollback capabilities, achieving up to 2.95x speedup and improved generation quality.

0 人收藏 0 人点赞
#training-free

SkillAligner: Treating Retrieved Skills as Adaptable Drafts at Execution Time

arXiv cs.LG · 2天前 缓存

This paper introduces SkillAligner, a training-free framework that treats retrieved skills as adaptable drafts, jointly adapting them to task requirements, execution environments, and other skills to mitigate skill-execution misfit and improve agent performance.

0 人收藏 0 人点赞
#training-free

KReF:面向长期时间序列预测与预测不确定性的免训练检索

arXiv cs.LG · 2天前 缓存

KReF 提出了一种用于长期时间序列预测的免训练检索框架,该框架从相似的历史回看-未来对中构建经验预测分布,在多个基准上取得了优异的 CRPS 表现。

0 人收藏 0 人点赞
#training-free

KLQ: Training-free measured rotation quantization. Beats all training-free rotation-based quantization methods on W4A4KV4-bits. Llama 3.2 1B KLQ-quantized beats SpinQuant and gets close to ReSpinQuant without GPTQ/LDLQ rounding.

Reddit r/LocalLLaMA · 2天前 缓存

KLQ is a training-free LLM quantization method that allocates bits per direction based on measured KL divergence, outperforming existing training-free rotation-based methods on W4A4KV4-bit settings for models like Llama 3.2 1B and Qwen 2.5.

0 人收藏 0 人点赞
#training-free

约束优先推理:一种利用答案空间约束进行数学问题求解的免训练协议

arXiv cs.CL · 5天前 缓存

该论文提出了约束优先推理(CFR),一种免训练的两阶段提示协议,在求解前提取答案空间约束,并检查中间及最终结果是否符合这些约束,从而在竞赛基准测试中提升了数学问题求解性能。

0 人收藏 0 人点赞
#training-free

ConWriter:基于过渡约束的有状态长篇故事生成与轻量级神经符号一致性控制

arXiv cs.CL · 5天前 缓存

ConWriter 引入了一种无需训练的框架,用于长篇故事生成,通过场景级增量写作、符号状态推理和不确定性感知的风险信号来维持叙事一致性。在 ConStory-Bench 上跨多个模型和长度进行了评估,旨在防止一致性错误在扩展上下文中传播。

0 人收藏 0 人点赞
#training-free

基于肘部的MoE路由:一种免训练的推理时插件用于专家选择

arXiv cs.LG · 6天前 缓存

本文介绍了基于肘部的路由,这是一种针对MoE模型的免训练推理时方法,通过检测路由器概率分布中的肘部点,动态调整每个令牌的活跃专家数量,在保持准确率的同时实现了平均5.3%的延迟降低。

0 人收藏 0 人点赞
#training-free

基于大语言模型的运筹学不确定性感知仿真推断

arXiv cs.LG · 2026-08-04 缓存

本文提出了一种无需训练、不确定性感知的推断框架,用于在运筹学中应用大语言模型。该方法使用短视前瞻仿真和重要性重采样来提高数学公式表述的一致性,在OR基准测试上优于标准基线。

0 人收藏 0 人点赞
#training-free

OmniPack:面向高效全模态大语言模型的统一令牌压缩

Hugging Face Daily Papers · 2026-08-04 缓存

OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。

0 人收藏 0 人点赞
#training-free

GaussianSelector:基于图优化的3D高斯溅射中轻量级人工引导物体选择

Hugging Face Daily Papers · 2026-08-02 缓存

GaussianSelector是一个无需训练的框架,利用涂鸦引导从稀疏视图进行交互式3D物体选择,并通过图割优化直接对高斯图元进行操作。

0 人收藏 0 人点赞
#training-free

Prox:通过近似中间通道显著性在LLM中实现免训练FFN激活稀疏性

arXiv cs.LG · 2026-07-31 缓存

Prox是一个用于LLM中稀疏SwiGLU FFN的免训练框架,利用近似中间通道显著性来构建通道掩码,无需密集计算。在十个LLM上,Prox优于免训练基线,在70%稀疏度下实现了高达1.99倍的端到端解码加速。

0 人收藏 0 人点赞
#training-free

整体之稀疏一瞥:无需训练的自推测解码

arXiv cs.CL · 2026-07-31 缓存

本文介绍了SparseSpec-L,一种用于长上下文LLM推理的无需训练的自推测解码框架,它使用动态稀疏化且可召回(recallable)的KV缓存,以及基于熵的推测长度控制器,相比自回归解码可实现高达2.79倍加速。

0 人收藏 0 人点赞
#training-free

先召回再排序:基于相似性引导的 Top-$K$ 复用于高效长上下文注意力

arXiv cs.CL · 2026-07-31 缓存

ReTopK 是一种无需训练的方法,通过复用历史查询-支持对来加速长上下文大语言模型中的动态 Top-K 稀疏注意力,从而避免全上下文评分和全局 Top-K 选择。在 128K 上下文下,相比精确 Top-K,它实现了最高 3.07 倍的加速,且困惑度仅增加 0.50%。

0 人收藏 0 人点赞
#training-free

RAG-HAR+:面向边缘部署的成本高效基于LLM的人体活动识别

arXiv cs.LG · 2026-07-30 缓存

RAG-HAR+ 是RAG-HAR的一种检索优先、成本优化的扩展,用于从可穿戴传感器进行人体活动识别。它利用检索设计器代理和多数投票机制,在降低LLM使用量的同时保持准确率,并展示了边缘部署的可行性。

0 人收藏 0 人点赞
#training-free

推理时指令层次控制

arXiv cs.CL · 2026-07-30 缓存

介绍V-Steer,一种无需训练的推理时方法,通过编辑缓存的值向量恢复语言模型中的指令层次,在受控基准上将主要约束准确率从低于18%提升至92%,且开销可忽略。

0 人收藏 0 人点赞
#training-free

IRIS:基于冻结大语言模型的可复用身份表示用于实体对齐

arXiv cs.CL · 2026-07-29 缓存

IRIS是一个无需训练的框架,利用冻结的大语言模型为知识图谱中的实体构建可复用的身份表示,从而能够在不同知识图谱间实现高效的实体对齐,无需依赖配对处理。

0 人收藏 0 人点赞
#training-free

用于免训练多跳问答的图与文本记忆协同进化

arXiv cs.CL · 2026-07-28 缓存

提出Co-E,一种免训练系统,同步图记忆与文本记忆用于多跳问答,在六个基准上优于可比的免训练基线。

0 人收藏 0 人点赞
#training-free

超越全球规范:无需重新训练的语言模型毒性敏感性个性化

arXiv cs.CL · 2026-07-28 缓存

本文首次对推理时无需训练的语言模型毒性敏感性个性化方法进行了比较评估,显示所有方法均能将对齐错误减少28-47%,但揭示了对齐效果、个性化与语言质量之间的权衡。

0 人收藏 0 人点赞
#training-free

OmniScope:全模态大语言模型的模态解耦令牌压缩

Hugging Face Daily Papers · 2026-07-28 缓存

OmniScope是一个面向全模态大语言模型的无训练令牌压缩框架,它使用查询作为共享锚点,分别评估音频和视频的相关性,实现了高达3.53倍的预填充加速和超过15%的GPU内存减少,且精度损失极小。

0 人收藏 0 人点赞
#training-free

DWT-Fusion: 一种基于信号的免训练LLM生成文本检测框架

arXiv cs.CL · 2026-07-27 缓存

介绍DWT-Fusion,一种免训练框架,通过对token级对数概率进行离散小波分析来检测LLM生成的文本,在多个数据集上取得了优异的AUROC结果。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈