来自6.6万集播客的叙事语义地图

Reddit r/ArtificialInteligence 工具

摘要

作者构建了一个流水线,将6.6万集播客转录,提取并聚类超过70万个观点到二维语义地图中,用于追踪投资叙事,并过滤掉AI生成的内容。

我注意到,投资叙事常常在播客上先于主流媒体出现。我想用一种系统化的方式来识别和追踪它们。于是我构建了一个流水线:转录播客剧集,从每一份转录文本中提取独立观点,将相关观点嵌入并聚类成主题,然后绘制在二维语义地图上。这张地图基于从过去五个月发布的6.6万集播客中挖掘出的超过70万个独立观点构建而成。其中一个较难的数据清理问题是如何过滤掉AI生成的剧集。进入流水线的金融播客中,约有15%包含合成内容。完全合成的节目相对容易移除。较难处理的是那些将AI生成的剧集与真实剧集混合在一起的节目。在地图上,你可以放大查看任何主题,观察讨论量随时间的变化,追踪其中的关键动态,并聆听背后的原始播客片段。你可以在这里查看:https://www.sonicalpha.ai/atlas https://preview.redd.it/rh3fjansy7hh1.png?width=1203&format=png&auto=webp&s=313b90963a9cbf565e35f492ad743938b569ecf2 期待你的反馈。谢谢
查看原文

相似文章

我的无监督合规层项目

Reddit r/artificial

一位开发者构建了一个无监督多智能体流水线,让 Claude 和 GPT-4 自主筹备并托管一档播客:自动选题、策划单集内容,并在 10 轮对话后输出文本转语音。