标签
GigaChat Audio 10B是一个原生音频大语言模型,基于GigaChat 3.1 Lightning构建,集成了Conformer语音编码器和模态适配器,用于音频问答、时间定位和工具使用。
详细介绍了一种在微控制器上直接运行拥有13M参数的ASR Conformer模型的方法,突出了边缘AI部署的进步。
本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。
本文提出了一种多模态框架,利用瓶颈编码器和带门控机制的RoBERTa,联合改进印度语言的自动语音识别(ASR)和方言识别(DID)。在包含33种方言的八种语言上评估,该方法实现了81.63%的方言识别准确率,并将CER/WER降低至4.65%/17.73%。
本文介绍HRVConformer,一种混合卷积-Transformer架构,用于直接从原始心率信号中分类新生儿缺氧缺血性脑病,实现了83.23%的AUC,性能优于ResNet50和Transformer等基线模型。
本文提出了一种端到端的基于Conformer的神经解码器,用于从一位肌萎缩侧索硬化症(ALS)参与者的皮层内记录进行语音解码,在没有任何外部语言模型的情况下,字符错误率达到23.80%。该研究表明,在完全端到端的框架中实现有意义的字符级解码是可行的。