@AdinaYakup: Hy-MT2 来自@腾讯混元的新翻译模型系列 1.8B/7B/30B-A3B MoE 支持33种语言 1.8B > 440MB 通过…
摘要
腾讯混元发布了Hy-MT2翻译模型系列,最高含30B参数的MoE模型,支持33种语言,并经过量化可用于设备端。
Hy-MT2 🔥 来自@腾讯混元的新翻译模型系列
✨ 1.8B / 7B / 30B-A3B MoE
✨ 支持33种语言
✨ 1.8B参数模型通过1.25位量化压缩至440MB
✨ 可在设备上运行,推理速度更快
✨ 1.8B模型表现优于部分商业API https://t.co/Ep7gL8wedk
查看缓存全文
缓存时间: 2026/05/22 03:53
Hy-MT2 🔥 来自 @TencentHunyuan 的全新翻译模型系列
✨ 1.8B / 7B / 30B-A3B MoE ✨ 支持33种语言 ✨ 1.8B通过1.25位量化后小于440MB ✨ 可在设备上运行,推理速度更快 ✨ 1.8B性能超越部分商业API https://t.co/Ep7gL8wedk
相似文章
在16GB显卡上运行Vision Qwen 3.8 27B的配置(45tks)
用户分享在16GB GPU上使用beellama运行Vision Qwen 3.8 27B模型的配置,实现每秒45 token的解码速度和85K上下文。
@jakevin7: 哇靠,这太惊人了!DeepSeek,这真的只是小版本的微调吗???V4.1 Flash 做了大量……
DeepSeek V4.1 Flash 引入了针对长上下文处理的架构改进,包括因果编码器-解码器、CSA2、分层稀疏索引器和量化,从而大幅优化了内存和计算。
SalamandraTA at WMT 2026 Terminology Shared Task: 困难样本是更好的教师
本文提出了一种用于术语感知翻译的数据选择方法,仅在模型输出与术语表相矛盾的困难样本上进行训练,从而提高了术语准确率,并描述了BSC系统在WMT26术语共享任务中的提交。
SEA-SpeechBench: 东南亚语音理解的大规模多任务基准测试
SEA-SpeechBench是首个大规模多任务基准测试,用于评估11种东南亚语言的语音理解,揭示了当前模型的性能差距。
BuzzASR:100+单语语音识别模型的集群
BuzzASR 是一系列语言特化的 Whisper 模型,用于102种语言的自动语音识别,在77种语言上优于 Whisper-large-v3,并在错误率和压缩效率方面有显著提升。