audio-processing

标签

Cards List
#audio-processing

Skred(自创声音引擎)作为效果器

Lobsters Hottest · 2天前 缓存

一段视频演示了一个 GUI 前端实验,该实验使用 Skred 声音引擎作为音频效果处理器,其设计灵感来自 Korg DW-8000 的数字延迟线。该项目在 GitHub 上以 MIT 许可证开源。

0 人收藏 0 人点赞
#audio-processing

使用FFmpeg模拟磁带音频特征

Hacker News Top · 2026-07-26 缓存

一个GitHub项目,利用FFmpeg模拟磁带音频特征,包括磁带噪声、抖动/颤动、带宽限制以及均衡器调整。提供针对不同磁带类型的脚本。

0 人收藏 0 人点赞
#audio-processing

@oliviscusAI: Microsoft 刚发布了一个工具,可以一次性转录整整一小时的音频,并追踪谁在什么时候说话。它叫……

X AI KOLs Timeline · 2026-07-20 缓存

Microsoft 发布了 vibevoice,这是一个7B参数的模型,可以一次性转录长达一小时的音频,内置说话人日志和时间戳,支持50多种语言,并且本地运行,无需API费用。

0 人收藏 0 人点赞
#audio-processing

@YichiZ03: https://x.com/YichiZ03/status/2078588932191895976

X AI KOLs Timeline · 2026-07-18 缓存

MOSS-TD是一个说话人感知的ASR系统,在SGLang-Omni服务栈中进行了优化,能够在单张H100上以约49秒转录38分钟的多说话人音频,并支持16个会议的并发处理。

0 人收藏 0 人点赞
#audio-processing

@huckiyang: https://x.com/huckiyang/status/2077625513384841679

X AI KOLs Timeline · 2026-07-16 缓存

Inkling 是一个 975B 参数的混合专家模型(41B 激活参数),支持 100 万上下文窗口,采用 Apache-2.0 许可证。它引入了一种新颖的音频前端,使用一个 790 万参数的查找表替代传统编码器,在语音任务上取得了强劲性能。该模型在 45 万亿文本、图像、音频和视频 token 上进行了预训练。

0 人收藏 0 人点赞
#audio-processing

将歌声转化为可打印的音符(在浏览器中)

Hacker News Top · 2026-07-14 缓存

基于浏览器的工具,可将歌声转换为可打印的乐谱,并具有可调参数,包括音高容差、噪声门和音符分割灵敏度。

0 人收藏 0 人点赞
#audio-processing

@MireloAI: 今天,我们与@kyutai_labs合作,推出了全新的Audio-to-MIDI模型。它能接收完整的录音,并识别…

X AI KOLs Following · 2026-07-10 缓存

Mirelo AI与Kyutai Labs合作,推出了一款开源的Audio-to-MIDI模型,该模型能将完整的音乐混音转录为每个乐器的单独MIDI音轨,并直接从混音中检测和弦、调性和节奏,无需分离的音轨。

0 人收藏 0 人点赞
#audio-processing

MuScriptor:一个用于多乐器音乐转录的开放模型

Hugging Face Daily Papers · 2026-07-09 缓存

MuScriptor 是一个开源的多乐器音乐转录模型,能够将录音转录为每种乐器的 MIDI 音符,无需事先知道存在的乐器。

0 人收藏 0 人点赞
#audio-processing

@multimodalart: UniSE:统一语音增强的高质量开源模型,用于使音频清晰并分离多人对话中的说话者……

X AI KOLs Following · 2026-07-07 缓存

UniSE 是一个统一的、无需提示的、自回归语音增强模型,基于纯解码器语言模型,支持单一模型内完成语音恢复、目标说话人提取和语音分离等多种任务。

0 人收藏 0 人点赞
#audio-processing

如何跟随鼓手

Hacker News Top · 2026-07-06 缓存

一篇技术博文,描述了一个实时系统的开发,该系统通过使用锁相环从鼓点中估计节奏和相位来跟随鼓手,使软件能够适应人类的感觉,而不是强迫鼓手跟随机器。

0 人收藏 0 人点赞
#audio-processing

@OrukLabs:这些模型从未被告知什么是情感。它们只被训练转录文字,或填充掩码音频。……

X AI KOLs Following · 2026-07-04 缓存

OrukLabs的一项研究表明,仅通过转录或掩码音频任务训练的语音模型,会自动在深层中学习表达情感,这一点通过映射真实语音片段得以揭示。

0 人收藏 0 人点赞
#audio-processing

[audio.cpp] GGML之音——C++/GGML原生ACE-Step、Stable Audio、HeartMuLa、RoFormer、HTDemucs发布。60秒生成10分钟音乐!

Reddit r/LocalLLaMA · 2026-07-03

audio.cpp发布重大更新,新增音乐/SFX生成和源分离功能,支持ACE-Step、HeartMuLa、Stable Audio 3和HTDemucs,在原生C++/GGML中实现长音乐生成高达10倍的实时速度。

0 人收藏 0 人点赞
#audio-processing

DSPi:一款为树莓派 Pico(RP2040)和 Pico 2(RP2350)量身打造的全功能音频 DSP 固件

Lobsters Hottest · 2026-06-26 缓存

DSPi 是一款开源固件,可将树莓派 Pico 变身为全功能数字音频处理器,支持房间校正、参数均衡器、矩阵混音等功能。

0 人收藏 0 人点赞
#audio-processing

海报:探索基于音频检测土耳其电话诈骗的极限

arXiv cs.CL · 2026-06-24 缓存

本文介绍了首个公开的多模态数据集,包含100个土耳其诈骗和良性电话通话,评估了七种大语言模型在原始音频、ASR转录和人工纠正转录下的表现。结果表明,基于转录的输入优于直接音频,凸显了在低资源语言中进行包容性AI安全研究的必要性。

0 人收藏 0 人点赞
#audio-processing

构建像人类一样轮流说话的语音AI代理——没人提醒你的陷阱

Reddit r/AI_Agents · 2026-06-20

本文分享了构建实时语音AI代理的宝贵经验,强调了正确的轮流发言、VAD处理、计费意识以及避免回声循环的重要性。

0 人收藏 0 人点赞
#audio-processing

从录音中去除'um'比听起来更难

Hacker News Top · 2026-06-12 缓存

一个本地CLI工具,利用OpenAI的Whisper检测并去除音频录音中的填充词(um、uh、erm),采用技术避免点击声和背景嘶嘶声等音频伪影。

0 人收藏 0 人点赞
#audio-processing

Hush

Product Hunt · 2026-06-09

Hush 是一个开源的噪声抑制工具,专为语音AI代理设计,可提升实时交互中的音频清晰度。

0 人收藏 0 人点赞
#audio-processing

@CopyRebeldia: 每月向你收费,把你的会议变成摘要的业务今天非常糟糕。微软发布了…

X AI KOLs Timeline · 2026-06-08 缓存

微软发布了VibeVoice开源模型,可一次性处理一整小时的音频,并返回带有说话人识别和时间戳的结构化文本,颠覆了付费转录服务。

0 人收藏 0 人点赞
#audio-processing

Show HN: Resonate – 低延迟高分辨率频谱分析

Hacker News Top · 2026-06-06 缓存

Resonate 是一种低延迟、低内存的算法,用于对音频信号进行感知相关的频谱分析,采用带有指数加权移动平均的谐振器模型。

0 人收藏 0 人点赞
#audio-processing

@svpino:我为两家不同的公司构建了两个语音管道。它们看起来都是这样的:音频 → STT → 清理转录 → ……

X AI KOLs Following · 2026-06-05 缓存

Santiago 指出了传统 STT 管道在丢失语调和情感方面的局限性,然后介绍了 Modulate 公司的 Velma,这是一个原生语音 AI 模型,通过分析原始音频来捕捉意图、情感及其他声学信号,通过 API 获取,其成本比基于 LLM 的方法便宜 10 倍。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈