标签
一个轻量级的TTS实现,通过2000小时数据复现Audio8的训练,在H200上不到10小时训练就达到了0.72的SIM指标。
本文提出LA-ReduNet,一种轻量级自适应架构,该架构采用超球面流形学习和自适应步长,以显著减少神经网络中MCR2目标所需的层数,并用更少的参数实现相当的分类准确率。
LiLiCorr是一种轻量似然模型,通过关联每个位置的边缘分布来提高推测解码的令牌连贯性,从而增加语言模型推理中的接受长度和吞吐量。
构建并发布了BetterGPT-150M,一个紧凑的1.5亿参数因果语言模型,资源占用低,性能优于GPT-2 Small。包含用于文本补全的实时Hugging Face Space演示。
TurboVLA提出了一种新的视觉-语言-动作范式,直接将视觉和语言映射到动作,在LIBERO上仅用0.2B参数就达到了97.7%的成功率,并在消费级GPU上以32 Hz实现实时推理,显著降低了计算成本。
本文提出Light-MER,一个轻量级多模态情感识别框架,通过知识蒸馏将80亿参数的教师模型知识迁移至低于10亿参数的学生模型,在显著提升推理效率的同时取得了最先进的性能,挑战了参数超过10亿模型的必要性。
本文提出了一种适用于Moonshine等轻量级ASR模型的分词器移植流程,以解决孟加拉语中的自回归崩溃问题。通过将以英语为中心的分词器替换为BanglaBERT的WordPiece词汇表,词元繁殖度从9.16降至1.30,序列长度减少85.8%,在Lipi-Ghor数据集上实现了21.54%的词错误率(WER)。
本文介绍了SPAM(基于S3M的音系激活映射),一种利用自监督语音模型同时进行音素分割与识别的方法,该方法使用轻量级、免梯度下降的预测头,且只需要极少的音标转录数据。
MIThinker提出了一种轻量级推理模型,用于动机性访谈咨询代理,通过监督微调和强化学习训练生成治疗性思考,在较低计算量下实现了与最先进系统相当的MI能力。
本文系统评估了LLM在处理表格时的数据引用错误(DRE),并提出基于批评者的过滤和拒绝采样方法来提高答案准确性。一个轻量级的4B参数批评者模型在检测DRE方面达到了高准确率。
本文提出了一种基于AutoGen的轻量级多智能体框架,用于自动化混凝土护栏设计,实现了超过98%的准确率,并表明在该领域中小型模型可以超越大型模型。
Light-WAM是一种轻量级世界动作模型,用于高效机器人操作。它采用紧凑视频骨干网络和降采样潜在空间进行未来视频监督,在保持低推理延迟的同时实现了高性能。
腾讯开源的 Hy-MT2 系列多语言翻译模型,包含 1.8B、7B 和 30B-A3B(MoE)三种规模,支持 33 种语言,取得了业界领先的结果。其中轻量级的 1.8B 模型在性能上超越了微软和豆包的主流商业 API。