audio-encoder

标签

Cards List
#audio-encoder

X-AuT:针对语音大语言模型的渐进式音频编码器压缩与跨尺度蒸馏

Hugging Face Daily Papers · 昨天 缓存

X-AuT是一个渐进式框架,用于压缩语音大语言模型中的音频编码器层,通过跨尺度蒸馏和LoRA适配等技术,在降低推理成本的同时恢复准确性。

0 人收藏 0 人点赞
#audio-encoder

将E4B音频编码器添加到更大的模型

Reddit r/LocalLLaMA · 2026-05-15

作者提出一种方法,将E4B音频编码器添加到更大的模型中,通过提取编码器、创建线性投影层,并仅使用文本-音频对微调该层,类似于参考论文中的方法,但使用Gemma而非Whisper。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈