社交媒体兔子洞、簇群及随机游走的相对混合时间
摘要
利用领域共现数据和PCA/t-SNE对Twitter社区结构进行分析,揭示了紧密的右翼和松散的左翼集群,对推荐系统和随机游走混合时间具有启示意义。
<p><a href="https://lobste.rs/s/hmi3v1/social_media_rabbit_holes_clusters">评论</a></p>
查看缓存全文
缓存时间: 2026/08/07 22:26
# Twitter不是城镇广场,而是高中食堂
来源:https://notes.hella.cheap/twitter-isnt-a-town-square-its-a-high-school-cafeteria.html
本文的YouTube视频版本可以在这里找到(https://youtu.be/pAIKfmexU0Y)。
## 图表
Twitter一直被誉为一个单一的全球公共空间/城镇广场;一个没有任何子社区的大社区(与Reddit等有明确子社区的平台不同)。但显然,并不是所有Twitter用户都属于同一个社区。人们时常谈论Twitter的各个“部分”(例如TPOT、黑人Twitter、右翼Twitter等)。
那么,有人可能会问:“Twitter的这些不同部分是什么?”你或许能随口说出一些,但有一种方法可以客观地回答这个问题。
我在这里所做的是:
- 在2012年记录了Twitter的stream/sample API(随机抽样的推文)约一年
- 从这些推文的链接中提取域名
- 生成最常见的1万个域名的共现矩阵(即某个域名被同一用户推特提及的次数)
- 将该矩阵的行投影到2D(使用PCA和t-SNE)
由此得到这个图表:
一张图
## 亲和群体
不出所料,不同语言有各自明显的聚类。
有一些令人惊讶的亲和群体(至少对我来说);例如:妈妈博客(受众为幼儿母亲的博客)聚集得极为紧密。
妈妈博客
其中最有意思的发现(至少对我来说)是右翼聚类要比左翼聚类紧密得多。红色高亮的聚类是右翼,蓝色高亮的涂抹区域包含大多数左翼网站。
一张图
红色聚类只包含右翼内容,而且确实只有右翼内容。它连接得极其紧密。
蓝色涂抹区域包含所有左翼和自由派媒体。它一点也不紧密。例如,赫芬顿邮报的紧邻不是“民主现在”和“当代事务”,而是Mashable、雅虎新闻和LinkedIn。Slate的紧邻是洛杉矶NBC附属机构和路透社。而“每日来电者”的紧邻则是《华盛顿时报》、RedState.com、BizPacReview.com。
## 随机游走
这种紧密聚类的差异对推荐系统的工作方式有重要影响。例如,Twitter的“Who to Follow”系统就是基于与我这里使用的类似的嵌入来推荐关注账户(不过它使用的是关注图而不是域名)。
Who to Follow(以及其他推荐系统,比如“为你推荐”页面中使用的那些)会向用户推荐他们已经喜欢事物的近邻。
假设有两个用户,A和B。A看福克斯新闻,B读《卫报》。
B创建了一个Twitter账户,关注了他们最喜欢的《卫报》专栏作家。由于《卫报》处于那个巨大的涂抹区域,其中包含主流媒体和与政治无关的内容,B会得到各种推荐关注账户:纽约时报专栏作家、体育人物、时尚网红等。他们在每一步得到的推荐都有高方差,这意味着他们关注的事物的邻居种类繁多,因此推荐也多种多样,这也就意味着这个随机游走的混合时间很短。之所以是随机游走,是因为每一步(关注行为)是从推荐账户列表中随机选择的,而推荐账户又是用户已关注账户的邻居。混合时间短意味着,在很少几步之后,仅凭起始位置就无法预测用户去了哪里。推荐可能把你带到任何地方。
A创建了一个Twitter账户,关注了他们最喜欢的福克斯新闻人物。由于右翼账户紧密聚集,如果你关注右翼账户,你只会被推荐其他右翼账户。这意味着这个随机游走混合性差;只要知道用户的起点,你就能很好地猜测用户的去向(在那个紧密聚类的某个地方),即使过了很长时间也是如此。
当人们含糊地谈论社交媒体“兔子洞”时,他们所指的就是这个具体的东西。
这种聚类紧密程度的差异解释了为什么右翼社交媒体比左翼社交媒体更擅长把人困在兔子洞里。这也在一定程度上解释了为什么右翼在像Twitter这样的网站上相对成功得多。
## 高中食堂
这种聚类给你的感觉更像高中食堂,而不是城镇广场。运动员坐在运动员桌,只和别的运动员交谈;刻薄女孩坐在刻薄女孩桌,只和彼此交谈;大多数人则坐在基本上是随机选择的地方。
大多数人不是这些紧密小圈子的成员,但大部分闹剧都来自那些桌子。
## 交互式图表
这里有一个交互式图表,你可以自己玩一玩。用鼠标悬停即可看到域名。你会发现哪些社区呢?
相似文章
Show HN: 探索预测市场与社交媒体的交叉点
探索预测市场与社交媒体之间可能的交叉点,重点关注流行度可能发挥的作用。
默认极化:LLM 内容策展中的推荐偏差审计
本文对 OpenAI、Anthropic 和 Google 的基于 LLM 的内容策展推荐偏差进行了大规模审计,使用了来自 Twitter/X、Bluesky 和 Reddit 数据的 540,000 次模拟选择。研究发现 LLM 系统性地放大极化现象,在毒性处理方面表现出不同的权衡,并显示出显著的政治倾向偏差,倾向于左倾作者,尽管数据集中右倾作者占多数。
@dosco:关于把 RLM 和 DSPy 用在多模态数据上的酷文,这段让我脑洞大开……
一条社交媒体动态,推荐一篇把 RLM 和 DSPy 应用于多模态数据的文章。
基于LLM的操纵性政治叙事检测
一种结合基于提示的过滤和无监督聚类的计算框架,用于从社交媒体帖子中识别操纵性政治叙事聚类,无需预定义类别。
社交媒体的下一次进化:用户可控算法
像Threads、Instagram和TikTok这样的社交媒体平台正在推出工具,允许用户个性化他们的推荐算法,让用户对自己的信息流有更多控制权。