GigaChat Audio: 时间感知的大型音频语言模型
摘要
本文介绍了 GigaChat Audio,一个时间感知的大型音频语言模型,能够对长达120分钟的音频回答问题并给出明确的时间戳,使用交错周期性时间标记和合成监督。该模型在基准测试中实现了强时间定位准确性,作者已发布模型权重和数据集。
查看缓存全文
缓存时间: 2026/07/21 10:36
论文页面 - GigaChat Audio:时间感知的大规模音频语言模型
来源:https://huggingface.co/papers/2607.10387
摘要
对于音频条件的大语言模型而言,在长时间录音中进行时间定位仍然具有挑战性。我们提出了一种时间感知的音频大语言模型,能够对长达120分钟的输入进行带显式时间戳的问答。我们的方法通过级联管道的大规模合成监督,将周期性的时间标记与连续的音频令牌交错排列。该模型在短时和长时基准测试中均表现出强大的时间定位精度,并支持锚定时间点的片段描述和摘要。大量消融实验考察了时间表示、标记频率、分词方式和时长混合设计对精度和计算成本的影响。我们发布了模型权重和数据集,以支持时间感知音频理解的进一步研究,项目地址:https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B。
查看 arXiv 页面(https://arxiv.org/abs/2607.10387)查看 PDF(https://arxiv.org/pdf/2607.10387)项目页面(https://huggingface.co/ai-sage/GigaChat3.1-Audio-10B-A1.8B)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2607.10387)
相似文章
面向大型音频语言模型的连续音频思考
该论文引入了连续音频思考(CoAT)框架,为大型音频语言模型配备了一个连续的潜在工作空间,用于在生成文本响应之前组织声学信息,从而在音频推理、理解和转录任务中提升性能,且不增加额外的解码成本。
GigaAM Multilingual: Foundation Model for Underrepresented Languages
本文介绍了 GigaAM Multilingual,这是一种基于 Conformer 编码器的模型,采用 HuBERT 风格的目标函数在 200 万小时音频上预训练,解决了中亚语言(哈萨克语、吉尔吉斯语、乌兹别克语)的数据稀缺问题。它通过集群级数据平衡和领域感知采样,在目标语言上超越了 Whisper Large v3 等强基线模型。
Temporal awareness with GPT-Live
OpenAI发布了GPT-Live模型,具备持续在场和时间感知能力,支持打断式语音交互和实时计时功能,提升了语音助手的自然度和实用性。
连续音频语言模型
本文介绍了连续音频语言模型(CALM),该模型使用连续帧而非离散token生成音频,以提升语音和音乐生成的保真度并降低计算成本。
大型语言模型能否模仿人类语音进行临床评估?基于LLM的数据增强方法用于认知评分预测
本文提出了一种基于大型语言模型的数据增强框架,利用GPT-5从书面锚点生成合成口语独白,用于从语音中预测认知评分。一种相似性引导的选择策略持续降低了预测误差,特别是对于少数低分参与者。