efficient-deployment

标签

Cards List
#efficient-deployment

Pro-Router: 面向token的渐进式模型路由与自适应边云协作,实现高效多模态LLM推理

arXiv cs.AI · 2026-09-01 缓存

Pro-Router引入了一种面向token的渐进式模型路由方法,用于高效多模态LLM推理,通过自适应边云协作提高吞吐量并降低成本。

0 人收藏 0 人点赞
#efficient-deployment

内存高效的表格基础模型

arXiv cs.LG · 2026-07-31 缓存

本文研究了TabPFN等表格基础模型的内存需求,并表明模型压缩(如INT4量化)可以将内存占用减少高达7.6倍,且精度损失极小,从而提升实际部署效率。

0 人收藏 0 人点赞
#efficient-deployment

ExTernD: 扩展秩三值分解——精度逼近任意量化水平的LLM训练后量化

arXiv cs.LG · 2026-07-16 缓存

ExTernD引入了一种扩展秩三值分解用于LLM训练后量化,通过使用具有自由内秩的因子化表示,使精度接近bf16。在Gemma-4和Qwen3.5等模型上,它以每个权重5.2-5.5有效比特达到Q4_K的精度。

0 人收藏 0 人点赞
#efficient-deployment

我们真的需要超过10亿参数的多模态情感语言模型吗?

arXiv cs.AI · 2026-07-15 缓存

本文提出Light-MER,一个轻量级多模态情感识别框架,通过知识蒸馏将80亿参数的教师模型知识迁移至低于10亿参数的学生模型,在显著提升推理效率的同时取得了最先进的性能,挑战了参数超过10亿模型的必要性。

0 人收藏 0 人点赞
#efficient-deployment

修剪不良专家需要MAESTRO

arXiv cs.CL · 2026-07-10 缓存

本文介绍了Maestro,一种针对混合专家语言模型的结构化剪枝框架。该框架利用马尔可夫链对专家激活轨迹进行建模,实现全局感知剪枝,在50%压缩率下,性能优于基线模型最高达10.61%。

0 人收藏 0 人点赞
#efficient-deployment

FlexMoE: 面向MoE语言模型的一体通用嵌套式专家内剪枝

arXiv cs.LG · 2026-06-29 缓存

FlexMoE提出了一种面向MoE语言模型的一体通用嵌套式专家内部剪枝方法,能够在单次训练中生成多个可部署的子网络,且性能损失极小。

0 人收藏 0 人点赞
#efficient-deployment

CAT-Q: 用于LLM的高效且准确的三值量化

arXiv cs.CL · 2026-06-26 缓存

CAT-Q 提出了一种面向LLM的训练后三值量化方法,该方法使用可学习调制和软化三值化技术,仅需512个校准样本即可实现优于BitNet 1.58-bit的性能,并可扩展到235B参数规模。

0 人收藏 0 人点赞
#efficient-deployment

TENP: 用于混合专家的梯形专家神经元剪枝

arXiv cs.LG · 2026-06-10 缓存

TENP 提出了一种用于混合专家大语言模型的结构化剪枝框架,该框架保留重要专家,对较不重要的专家进行神经元剪枝,从而在 Qwen 和 DeepSeek 模型上实现高稀疏度且精度损失极小。

0 人收藏 0 人点赞
#efficient-deployment

用于大语言模型压缩的联合结构化剪枝与混合精度量化

arXiv cs.AI · 2026-06-09 缓存

一种新颖的端到端大语言模型压缩框架,联合优化结构化剪枝与混合精度量化,在超低位宽精度下,相比于现有最先进方法实现了显著的困惑度降低和加速效果。

0 人收藏 0 人点赞
#efficient-deployment

BitsMoE: 基于谱能引导的MoE大语言模型高效量化比特分配

arXiv cs.LG · 2026-06-02 缓存

BitsMoE提出了一种基于谱能引导的比特分配框架,用于量化混合专家大语言模型,在超低位宽量化下实现了显著的精度提升和加速。

0 人收藏 0 人点赞
#efficient-deployment

@berryxia: Apple 一直其实在赌端侧模型的应用! 统一架构内存就是端侧模型的天然温床! 统一内存也就是,内存即显存。 也看到越来越多的优秀端侧模型出现。 OpenBMB 把 MiniCPM-V 4.6 这个 1.3B 的多模态模型放出来了,我看完…

X AI KOLs Timeline · 2026-05-12

OpenBMB 发布了 MiniCPM-V 4.6,一个 1.3B 参数的多模态模型,通过高分辨率视觉处理和高效压缩技术,在消费级硬件和手机上实现快速推理,性能超过同类大模型,且全面开源支持多种推理和量化框架。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈