标签
Unsloth 发布了 MiniMax-H3 的 GGUF 量化版本,MiniMax-H3 是一个支持原生立体声音频的全模态视频生成系统,可通过 sd-cli 及其他平台进行本地执行。
作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。
本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。
VibeVoice 1.5B 可在 iPhone 上本地运行,占用约 2.2 GB 内存,速度最高可达实时速度的 1.28 倍;作者计划发布 audio.cpp 的 xcframework 和代码。
Nothing 的平价子品牌 CMF 推出了其首款开放式耳机 CMF Clip Pro,售价 99 美元,采用开放式设计,支持多点蓝牙连接,总续航最长 33 小时。
OpenAI 宣布,音频现在使用专用快速通道,而推理和工具使用则异步运行,语音会话启动已从六次网络往返减少到一次。
对 Nothing Ear (3a) 无线耳机的评测,重点介绍其做工质量、佩戴舒适度,以及独特的、带有 AI 转录功能的音频快照功能。
Termixer 是一款用 Rust 编写的基于终端的 DJ 混音器,集成了 TidalCycles、MPV 和 SuperCollider,支持均衡器、交叉淡化及采样垫的实时混音。
Wired 评测并推荐了2026年仍配备耳机插孔的最佳智能手机,重点介绍了 Motorola Moto G Stylus 和 TCL 60 XE Nxtpaper 等型号,同时讨论了自苹果移除该插孔以来其逐渐衰落的情况。
MiniMax 发布 H3,这是一款开放的多模态生成模型,支持文本、图像、视频和音频,可生成最长 15 秒的 2K 视频并带有原生立体声,同时计划开源模型权重。
Nothing Ear 3A 耳机以99美元的价格提供出色的降噪和音频性能,但偶尔出现漏洞,默认音质低音过重,需调整均衡器。
audio.cpp 0.4 版本为 Higgs Audio v3 TTS 4B(10倍实时)和 Fish Audio S2 Pro 添加了基于 C++/GGML 的推理,支持完整 GGUF 加载,并实现了 Q8 速度与显存优化。