标签
微软发布了VibeVoice开源模型,可一次性处理一整小时的音频,并返回带有说话人识别和时间戳的结构化文本,颠覆了付费转录服务。
作者介绍了VoiceFlow,这是一款开源的本地听写和会议转录工具,并在6GB GPU上对小语言模型(qwen3.5:0.8b和Granite 4 350M)进行了会议总结基准测试,发现0.8B的Qwen可行,而低于500M的模型会出现幻觉。同时,作者向社区寻求在低显存环境下的长上下文总结解决方案。