标签
一段视频演示了一个 GUI 前端实验,该实验使用 Skred 声音引擎作为音频效果处理器,其设计灵感来自 Korg DW-8000 的数字延迟线。该项目在 GitHub 上以 MIT 许可证开源。
一个GitHub项目,利用FFmpeg模拟磁带音频特征,包括磁带噪声、抖动/颤动、带宽限制以及均衡器调整。提供针对不同磁带类型的脚本。
Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。
MOSS-TD是一个说话人感知的ASR系统,在SGLang-Omni服务栈中进行了优化,能够在单张H100上以约49秒转录38分钟的多说话人音频,并支持16个会议的并发处理。
Inkling 是一个 975B 参数的混合专家模型(41B 激活参数),支持 100 万上下文窗口,采用 Apache-2.0 许可证。它引入了一种新颖的音频前端,使用一个 790 万参数的查找表替代传统编码器,在语音任务上取得了强劲性能。该模型在 45 万亿文本、图像、音频和视频 token 上进行了预训练。
基于浏览器的工具,可将歌声转换为可打印的乐谱,并具有可调参数,包括音高容差、噪声门和音符分割灵敏度。
Mirelo AI与Kyutai Labs合作,推出了一款开源的Audio-to-MIDI模型,该模型能将完整的音乐混音转录为每个乐器的单独MIDI音轨,并直接从混音中检测和弦、调性和节奏,无需分离的音轨。
MuScriptor 是一个开源的多乐器音乐转录模型,能够将录音转录为每种乐器的 MIDI 音符,无需事先知道存在的乐器。
UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。
一篇技术博文,描述了一个实时系统的开发,该系统通过使用锁相环从鼓点中估计节奏和相位来跟随鼓手,使软件能够适应人类的感觉,而不是强迫鼓手跟随机器。
OrukLabs的一项研究表明,仅通过转录或掩码音频任务训练的语音模型,会自动在深层中学习表达情感,这一点通过映射真实语音片段得以揭示。
audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。
DSPi 是一款开源固件,可将树莓派 Pico 变身为全功能数字音频处理器,支持房间校正、参数均衡器、矩阵混音等功能。
本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。
本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。
一个本地CLI工具,利用OpenAI的Whisper检测并去除音频录音中的填充词(um、uh、erm),采用技术避免点击声和背景嘶嘶声等音频伪影。
微软发布了VibeVoice开源模型,可一次性处理一整小时的音频,并返回带有说话人识别和时间戳的结构化文本,颠覆了付费转录服务。
Resonate 是一种低延迟、低内存的算法,用于对音频信号进行感知相关的频谱分析,采用带有指数加权移动平均的谐振器模型。
Santiago 指出了传统 STT 管道在丢失语调和情感方面的局限性,然后介绍了 Modulate 公司的 Velma,这是一个原生语音 AI 模型,通过分析原始音频来捕捉意图、情感及其他声学信号,通过 API 获取,其成本比基于 LLM 的方法便宜 10 倍。