efficiency

标签

Cards List
#efficiency

@shikhargupta02: 我一直在学习潜在注意力(来自 DeepSeek)。它不是为每个 token 存储完整的 K 和 V 向量,而是……

X AI KOLs Timeline · 昨天 缓存

作者分享了他用 DeepSeek 的潜在注意力训练一个小模型的见解,观察到潜在空间的使用因层而异,以及一个可以将 KV 缓存减少 4 倍且损失不变的测试时技巧。

0 人收藏 0 人点赞
#efficiency

测试XPS 13后,我对Intel充满期待

Jeff Geerling · 昨天 缓存

Jeff Geerling评测了搭载Intel Core 5 320的Dell XPS 13,着重介绍其出色的能效和Linux兼容性,并对Intel的低端处理器方向表示乐观。

0 人收藏 0 人点赞
#efficiency

7.9B总参数中激活1.3B,面向智能体工作。这条曲线在哪里变平?

Reddit r/ArtificialInteligence · 2天前

InclusionAI(蚂蚁集团实验室)发布了Ling 3.0 Tiny,一个封闭API模型,总参数7.9B中激活1.3B,支持256K上下文、原生函数调用,并具备思考/即时模式,面向多轮智能体工具循环。文章质疑其效率曲线,并指出尚无独立评测或开放权重。

0 人收藏 0 人点赞
#efficiency

GROM:无梯度的快速一次性机器遗忘

arXiv cs.LG · 2天前 缓存

介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。

0 人收藏 0 人点赞
#efficiency

@maximelabonne: 哇,这让我想起了早期的模型合并。完全疯狂,我喜欢!

X AI KOLs Following · 2天前 缓存

一个采用融合架构的新型sub-6B稀疏激活AI模型,结合了LFM2.5-2.6B和Qwen3.6-35B-A3B的权重,以极小的尺寸实现了接近Qwen3.6-35B的性能。

0 人收藏 0 人点赞
#efficiency

EASy:迈向基于LLM的高效智能体系统

arXiv cs.CL · 3天前 缓存

本文提出了EASy,一个可训练的智能体框架,利用强化学习联合优化任务性能与计算效率,并引入了里程碑-规划-执行工作流、依赖感知执行图和用于训练的树形展开。

0 人收藏 0 人点赞
#efficiency

基于二值主成分的无训练哈希注意力

arXiv cs.LG · 3天前 缓存

介绍了BinaryPC,一种面向长上下文大语言模型的无训练哈希稀疏注意力方法,利用二值主成分构建哈希码,在保持准确率的同时,解码吞吐量较FlashAttention提升了3.56倍。

0 人收藏 0 人点赞
#efficiency

EvtGraph:多模态时间序列中稀疏时序图学习的事件自适应压缩

arXiv cs.LG · 3天前 缓存

本文介绍了EvtGraph,一个高效的多模态时序图学习框架,在预算约束下将序列压缩为事件级令牌,在临床和跨领域基准上展示了相较于Transformer和循环基线更好的性能与效率。

0 人收藏 0 人点赞
#efficiency

基于LeJEPA自监督预训练的纯注意力白盒Transformer

arXiv cs.LG · 3天前 缓存

本文提出了一种基于LeJEPA自监督预训练的纯注意力白盒Transformer,在CIFAR-10/100上取得了具有竞争力的准确率,同时与CRATE相比参数量减少约31%,并进一步展示了标准ViT中MLP的冗余性。

0 人收藏 0 人点赞
#efficiency

递归残差量化:一种面向大语言模型的渐进式多精度表示

arXiv cs.LG · 3天前 缓存

提出了递归残差量化(RRQ),这是一种训练后量化框架,通过加法式残差细化,从单个LLM检查点获得多种有效精度,从而提高了灵活性和构建速度。

0 人收藏 0 人点赞
#efficiency

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers · 3天前 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞
#efficiency

仅用64个视觉token,460M VLM在iPhone上首token延迟降至0.3秒

Reddit r/LocalLLaMA · 3天前

VisionPsy-Nano-460M-Flash 是一款全新的460M视觉语言模型,每张图像仅使用64个视觉token,在iPhone上首token延迟降至0.3秒,同时保留了完整模型约99%的基准分数。这种优化牺牲了部分OCR和精细细节质量。

0 人收藏 0 人点赞
#efficiency

AcceptMoE: Commitment-Weighted Self-Sizing Verifier Expert Sets for Efficient MoE Speculative Decoding

arXiv cs.LG · 4天前 缓存

AcceptMoE is a verifier-side expert selection method for speculative decoding of MoE LLMs, which reduces expert-weight traffic and improves throughput by up to 2.06x under expert offloading with minimal accuracy loss.

0 人收藏 0 人点赞
#efficiency

ATFlash: Per-RoPE-Wavelength Attention Windows for Compute/Memory-Efficient LLM Inference

arXiv cs.LG · 4天前 缓存

ATFlash introduces a per-RoPE-wavelength distance window that prunes query-key inner-product terms proportional to each frequency pair's wavelength, cutting 37-48% of attention compute with minimal quality loss and up to 1.31x speedups on long-context LLM inference.

0 人收藏 0 人点赞
#efficiency

Intern S2 Mobius

Reddit r/LocalLLaMA · 4天前

Intern-S2 Mobius 是一个基于 Qwen3.5-35B 的模型,其架构差异据称可提高吞吐量并减少 token 消耗。

0 人收藏 0 人点赞
#efficiency

OoO-Spec:用于快速工具调用的无序语义推测

arXiv cs.CL · 5天前 缓存

介绍了 OoO-Spec,一种通过小型辅助模型以无序方式计算语义槽位来加速 LLM 工具调用的方法,相比自回归解码实现了最高 5.34 倍的加速,并在多个目标和基准测试中超越了现有的草稿模型方法。

0 人收藏 0 人点赞
#efficiency

SparseKAN: Compressing Kolmogorov--Arnold Networks Across Basis Functions, Neurons, and Bits

arXiv cs.LG · 5天前 缓存

SparseKAN is a unified compression method for Kolmogorov–Arnold Networks that prunes basis functions, neurons, and numerical precision under learnable gates, achieving up to 73% parameter reduction and significant latency improvements on software and FPGA hardware.

0 人收藏 0 人点赞
#efficiency

OmniPack:面向高效全模态大语言模型的统一令牌压缩

Hugging Face Daily Papers · 5天前 缓存

OmniPack提出了一种无需训练的全模态大语言模型令牌压缩框架,将LLM前结构化压缩与LLM内任务相关语义精炼相结合,在多个基准上实现了优异的性能-效率权衡。

0 人收藏 0 人点赞
#efficiency

@peony__snow:在ARC-E上提升+3.2,仅需+0.0024%的参数和+0.056%的FLOPs。Frac-Connections重新审视残差连接,通过划分隐藏状态而不是扩展它们……

X AI KOLs Timeline · 5天前 缓存

Frac-Connections是一种新方法,通过划分隐藏状态而非扩展它们,将Hyper-Connections扩展到分数扩展率。与残差连接相比,它在几乎不增加计算量的情况下实现了更强的下游性能,并在高达7B的MoE语言模型上得到了验证。

0 人收藏 0 人点赞
#efficiency

隐式机器学习力场加速分子动力学模拟

arXiv cs.LG · 6天前 缓存

介绍了隐式机器学习力场(I-MLFFs),该力场用不动点方程替代深层神经网络堆叠,支持热启动,并在用于分子动力学模拟的图神经网络架构上实现最高5倍的计算/内存节省。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈