我花了不少时间尝试让LLM制作出真正值得听的播客。难点不在模型本身。
摘要
一位开发者分享了让LLM生成的播客听起来更自然的技术,包括使用约束条件迫使产生分歧,以及在生成前预先编辑内容。
我想知道LLM能否生成一个我愿意主动去听的播客——具体来说,就是把Hacker News的讨论串变成音频。结果发现,写脚本反而是最简单的20%。剩下的就是对抗模型默认想做的一切。两个方法最有效:1. 约束条件胜过指令。告诉模型“要像对话一样”毫无效果。真正管用的是给两位主持人不同的信息——一个只读文章,另一个只读评论。他们因为掌握的事实不同,根本无法达成一致,所以会争论起来,而不是礼貌地互相点头。这一个约束条件比任何“自然一点”的提示都管用。2. 先生成前编辑。把整个评论串都丢进去,模型会平等对待每条评论——结果就像会议纪要。先加一个廉价的“制作人”模型,让它决定这集播客的主题,并挑选出几条值得讨论的评论,然后主模型再写稿,这是质量提升最大的一步。过程中也有一些搞笑的失败案例:模型把“API”读成“appy”,把1,204读成“一千两百零四”,还有一次我在脚本里加了“[叹气]”想增加点人性,结果语音只是面无表情地念出了“叹气”这个词。完整文章及音频示例:https://hnlisten.app/blog/i-told-the-ai-to-sigh 好奇其他在做AI生成音频/对话的人有没有什么诀窍来解决“听起来不像论文”的问题——尤其是如何强制产生真正的分歧。
相似文章
论提高文档生成播客的忠实度
本文首次系统研究了文档接地播客生成中的忠实度问题,提出了一个轮次级别的LLM作为评委的评估框架,以及一个与模型无关的捕获-修复方法,该方法能跨领域提高忠实度。
@karpathy:我发现一个与 LLM 协作的好方法——来一场长而随性的闲聊。有时 LLM 需要更多的信息才能理解你试图实现的目标,但你懒得打那么多字。
Andrej Karpathy 分享了一个与 LLM 协作的技巧:使用语音进行 10 分钟漫无目的的闲聊,这有助于模型理解用户的意图,并且常常能生成更清晰的改述。
FunAudioLLM:面向人类与LLM自然交互的语音理解与生成基础模型
介绍FunAudioLLM,这是一个模型系列,结合了用于多语言ASR、情感检测和音频事件检测的SenseVoice,以及用于自然语音生成的CosyVoice,通过开源模型和代码实现与LLM增强的语音交互。
从零开始使用MLX构建大语言模型
一份关于使用Apple的MLX框架从零开始构建大语言模型的指南。
你的LLM评判者有多虚伪?大型语言模型语用能力中的听者-说者不对称性
本文通过比较LLM作为语言恰当性评判者与作为语用恰当语言生成者的表现,研究了LLM语用能力中的不对称性。研究发现,许多模型作为语用听者的表现显著优于作为说者的表现,表明评估能力与生成能力之间存在错位。