@AdinaYakup: NetEase Youdao的两个模型今日走红流式ASR模型:- 2B参数,采用NetEase自定义许可证 - 无输出修订…
摘要
NetEase Youdao发布了两款AI模型:一款是2B参数的流式ASR模型,另一款是14B参数的中英同声传译模型,均强调实时性能。
NetEase Youdao的两个模型今日走红 👀
✨ 流式ASR模型:
- 2B + NetEase自定义许可证
- 无输出修订,接近离线精度,160ms延迟
✨ 中英同声传译模型:
- 14B + Apache 2.0
- 自主决定何时等待或翻译,永不修订输出,并与R2T2配合进行语音处理。
查看缓存全文
缓存时间: 2026/09/24 00:15
网易有道的两款模型今日引发关注 👀
✨ 流式语音识别模型:
- 20亿参数 + 网易定制授权
- 无输出修正,接近离线精度,延迟仅160毫秒
✨ 中英同传模型:
- 140亿参数 + Apache 2.0协议
- 自主决定等待或翻译时机,输出永不回溯,可搭配R2T2语音系统
相似文章
@NetEaseYouDaoAI: 大多数流式ASR能快速给你文本。R2T2 给你可操作的文本。我们正在开源 Confucius4-R2T2,一个1.7B…
NetEase Youdao AI 正在开源 Confucius4-R2T2,一个1.7B的前沿实时流式ASR模型,专为语音代理设计,具有低延迟、高准确度和可配置解码块的特点。
netease-youdao/Confucius4-R2T2
Confucius4-R2T2 是网易有道开发的一款低延迟、高精度的实时语音识别模型,具有可配置的分块功能和稳定输出,适用于实时字幕等应用场景。
@FeitengLi: 99M 参数的 TTS 跑在 CPU 上,比 2B 大模型跑在 A100 上还快。 Supertone 新开源的 supertonic-3 ONNX Runtime,完全本地,浏览器能跑,手机能跑,树莓派也能跑。
Supertone released Supertonic 3, an open-source TTS model with 99M parameters that runs faster on CPU than a 2B model on A100, supporting 31 languages and ONNX Runtime for fully local inference.
@AdinaYakup: Mega-ASR https://huggingface.co/zhifeixie/Mega-ASR… 1.7B 参数,Apache 2.0,专为噪声/混响/截断/重叠说话人场景设计…
Mega-ASR 是一个1.7B参数的鲁棒ASR模型,采用Apache 2.0许可,专为噪声、混响和重叠语音设计,并配备音频质量路由器来处理干净音频和降质音频。
@HuggingModels: 你是否曾想过拥有一个能用中英双语专业聊天的紧凑型AI?认识Spark-X2.5-1.7B,一个虽小但强大的…
介绍Spark-X2.5-1.7B,一个紧凑的文本生成模型,专为中英双语流畅对话设计,已获得早期积极反馈。