内容深度在短视频推荐中的重要性:重新思考注意力经济

arXiv cs.AI 论文

摘要

本文介绍了内容深度分数(CDS)和SCOPE-Bench,用于评估短视频推荐系统的认知深度,揭示了现有系统优先考虑浅层内容而非更深层次参与。

arXiv:2608.13990v1 公告类型:新 摘要:在注意力经济的驱动下,短视频推荐系统(RSs)主要通过推广能在几秒钟内吸引注意力的视频来最大化用户参与度。这些系统本质上偏好那些能有效吸引即时注意力的浅层内容视频。然而,越来越多的证据表明,长期接触此类内容可能对用户的认知参与和心理健康产生负面影响,引发了对短视频平台长期社会影响的担忧。为应对这一挑战,本文引入了一个新指标,\textbf{内容深度分数(CDS)},以量化短视频的内容深度。CDS基于认知心理学和学习的既定理论,使用一个七级量表来衡量视频激发高级认知过程的程度。作为这一愿景的初步步骤,我们推出了\textbf{SCOPE-Bench},这是首个用于短视频推荐内容深度评估的基准。基于大规模开源短视频数据集,SCOPE-Bench为15万视频提供了CDS标注,使得从认知内容角度系统评估推荐系统成为可能。利用SCOPE-Bench,我们评估了13个代表性推荐系统,发现它们一致偏好浅层内容视频。此外,我们发现这些推荐认知深度内容的算法仅比随机选择略好,突显了现有推荐目标此前被忽视的局限性。我们的代码和数据集可在 https://liweidengdavid.github.io/SCOPE-Bench/ 获取。
查看原文
查看缓存全文

缓存时间: 2026/08/17 10:00

# 内容深度在短视频推荐中的重要性:反思注意力经济
来源:https://arxiv.org/html/2608.13990
景江 李志伟 通讯作者:李志伟 \(zhw\.li@outlook\.com\) 王洋 龙国栋

###### 摘要

在注意力经济驱动下,短视频推荐系统(RSs)主要通过推广能在数秒内吸引用户注意力的视频来最大化用户参与度。这些系统本质上倾向于能有效吸引即时注意力的浅层内容视频。然而,越来越多的证据表明,长期接触此类内容可能对用户的认知参与度和心理健康产生负面影响,引发了关于短视频平台长期社会影响的担忧。为应对这一挑战,本文引入了一个新指标——内容深度分数(Content Depth Score, CDS),用于量化短视频的内容深度。CDS基于认知心理学和学习理论,采用七级量表来衡量一个视频激发高阶认知过程的程度。作为实现这一愿景的第一步,我们提出了SCOPE-Bench,这是首个针对短视频推荐中内容深度评估的基准。基于大规模开源短视频数据集,SCOPE-Bench为15万视频提供了CDS标注,使得能够从认知内容角度系统评估推荐系统。利用SCOPE-Bench,我们评估了13个代表性推荐系统,并发现它们一致倾向于浅层内容视频。此外,我们发现这些推荐认知深度内容的算法仅略优于随机选择,突显了现有推荐目标此前被忽视的一个局限性。我们的代码和数据集可在以下地址获取:https://liweidengdavid\.github\.io/SCOPE\-Bench/\。

## 1引言

在注意力经济中,YouTube(Ørmen and Gregersen 2023 (https://arxiv.org/html/2608.13990#bib.bib35))、TikTok(TikTok Team 2021 (https://arxiv.org/html/2608.13990#bib.bib43))和快手(Kuaishou Technology 2025 (https://arxiv.org/html/2608.13990#bib.bib26))等平台上的短视频信息流已成为日常内容消费的核心渠道。成年用户现在每天在这些平台上花费超过一个小时(Kemp 2025 (https://arxiv.org/html/2608.13990#bib.bib23))。它们的推荐系统(RSs)(Zou and Sun 2025 (https://arxiv.org/html/2608.13990#bib.bib62);Li et al\. 2026 (https://arxiv.org/html/2608.13990#bib.bib27))优化参与度指标(如观看时长和点击),以将用户注意力转化为收入(García\-Rapp 2017 (https://arxiv.org/html/2608.13990#bib.bib7)),因此偏爱能够快速吸引用户注意力的视频。随着时间的推移,持续接触此类内容可能会削弱用户的持续注意力(Mahakud and Thapliyal 2026 (https://arxiv.org/html/2608.13990#bib.bib31)),并影响其长期福祉(Tang et al\. 2026 (https://arxiv.org/html/2608.13990#bib.bib42))。

图1:在参与度指标(X轴)和我们的内容深度指标(Y轴)上评估13个推荐系统(RSs)。区域根据内容深度指标分为三个级别:低(蓝色)、中(绿色)和高(红色)。虚线表示随机选择基线的内容深度。现有推荐系统在参与度指标上表现有竞争力,但其内容深度指标较低,接近随机选择。为参与度而优化奖励那些能留住用户注意力的视频,这引发了一个更根本的问题:推荐系统是否偏爱吸引注意力的内容,而非更有深度的视频?内容深度反映了一个视频展开其信息的深度,为用户提供了更丰富的理解、推理和反思机会(Chi and Wylie 2014 (https://arxiv.org/html/2608.13990#bib.bib6))。我们通过比较13个代表性推荐系统的参与度与其推荐视频的内容深度来审视这个问题。如图1 (https://arxiv.org/html/2608.13990#S1.F1)所示,每个推荐系统的内容深度表现都接近随机推荐。因此,更强的参与度并未转化为更高的推荐内容深度。

这种情况已引起研究之外的关注和应对。例如,澳大利亚(Australian Government 2025 (https://arxiv.org/html/2608.13990#bib.bib3))和英国(UK Government 2026 (https://arxiv.org/html/2608.13990#bib.bib44))已对短视频平台实施16岁以下限制,平台本身也对青少年的日使用时间进行限制(Keenan 2023 (https://arxiv.org/html/2608.13990#bib.bib22))。监管机构的这一共识表明,对年轻用户的伤害已得到广泛承认。然而,这些干预措施作用于访问而非内容。一个重要原因是缺乏对内容本身的任何衡量标准。

受促进更健康短视频和构建可持续短视频生态系统的需求启发,我们提出了一种新的指标来使内容深度可量化,使其能够在推荐系统评估和优化中作为一个明确的目标。本文提出了内容深度分数(CDS),一个衡量短视频向人类呈现和传递信息深度的新指标。CDS基于认知和学习理论(Wason and Evans 1974 (https://arxiv.org/html/2608.13990#bib.bib49);Anderson and Krathwohl 2001 (https://arxiv.org/html/2608.13990#bib.bib2);Biggs and Collis 2014 (https://arxiv.org/html/2608.13990#bib.bib5))的七级标准对视频进行评分,范围从低层次的情感刺激到高阶认知过程<sup>1</sup>。为在项目和推荐列表层面验证CDS,我们通过扩展现有的开源短视频数据集(Shang et al\. 2025 (https://arxiv.org/html/2608.13990#bib.bib40)),构建了SCOPE-Bench,即短视频内容深度评估基准。具体来说,我们为该数据集中的15万视频标注了CDS标签,涵盖了来自1万用户的约100万用户-项目交互。

<sup>1</sup>具体而言,在本文中,认知过程指的是个体获取、处理、存储和使用信息的心理操作(Sternberg, Sternberg, and Mio 2006 (https://arxiv.org/html/2608.13990#bib.bib41))。CDS衡量的是视频内容为这些操作提供的机会。

我们的主要贡献总结如下:

- •据我们所知,我们首次提出并系统研究了参与度优化推荐系统中对内容深度的忽视问题。
- •我们提出了CDS,第一个基于认知和学习理论的七级标准的视频内容深度量化指标。我们进一步将CDS扩展为推荐列表的列表级指标。
- •我们建立了视频内容深度的综合评估框架,并构建了SCOPE-Bench,一个包含15万视频、经过人工对齐CDS标注以及来自1万用户约100万交互的基准。
- •在SCOPE-Bench上的实验证实了CDS评估协议与人类判断高度一致。使用CDS评估13个代表性推荐系统,我们发现它们的推荐列表内容深度表现接近随机推荐,揭示了参与度和内容深度是解耦的。

## 2相关工作

### 2\.1内容质量评估

内容质量评估大致可分为*基于指标的评估*(针对明确可量化的属性)和*基于判断的评估*(针对难以用传统指标捕捉的开放式或解释性属性)。前者主要包括视频质量评估,包括感知保真度(Wang et al\. 2004 (https://arxiv.org/html/2608.13990#bib.bib47))、时间一致性(Wang, Lu, and Bovik 2004 (https://arxiv.org/html/2608.13990#bib.bib48))、生成真实性(Heusel et al\. 2017 (https://arxiv.org/html/2608.13990#bib.bib17))和跨模态对齐(Radford et al\. 2021 (https://arxiv.org/html/2608.13990#bib.bib38)),以及文本质量评估,涵盖语言(Napoles, Sakaguchi, and Tetreault 2017 (https://arxiv.org/html/2608.13990#bib.bib33))和语义属性(Barzilay and Lapata 2008 (https://arxiv.org/html/2608.13990#bib.bib4))、可信度(Lin, Hilton, and Evans 2022 (https://arxiv.org/html/2608.13990#bib.bib28))和安全性相关维度(Gehman et al\. 2020 (https://arxiv.org/html/2608.13990#bib.bib9))。对于开放式和解释性属性,近期研究越来越多地采用“LLM-as-a-Judge”(大语言模型作为评判者)作为灵活的基于判断的评估范式。现有方法范围从标量评分(Liu et al\. 2023 (https://arxiv.org/html/2608.13990#bib.bib29))和成对比较(Zheng et al\. 2023 (https://arxiv.org/html/2608.13990#bib.bib58))到基于标准的评估(Kim et al\. 2024 (https://arxiv.org/html/2608.13990#bib.bib24);Wang et al\. 2024 (https://arxiv.org/html/2608.13990#bib.bib46))和细粒度评估协议(Ye et al\. 2023 (https://arxiv.org/html/2608.13990#bib.bib53))。虽然有效,但这些方法仅提供了对内容深度的有限概念化。在本文中,我们系统地定义了内容深度,并提出了第一个量化指标,称为CDS,来衡量内容深度。

### 2\.2推荐系统评估

现有的推荐系统评估大致可分为*以系统为中心的评估*和*以用户为中心的评估*。以系统为中心的评估包括面向准确性的评估和超越准确性的评估(Zangerle and Bauer 2022 (https://arxiv.org/html/2608.13990#bib.bib56))。前者使用诸如精确率(Herlocker et al\. 2004 (https://arxiv.org/html/2608.13990#bib.bib16))、召回率(Allen et al\. 1955 (https://arxiv.org/html/2608.13990#bib.bib1))和NDCG(Järvelin and Kekäläinen 2002 (https://arxiv.org/html/2608.13990#bib.bib20))等指标来评估相关项目是否被准确检索和排序,而后者则考虑互补的推荐质量,包括多样性(Ziegler et al\. 2005 (https://arxiv.org/html/2608.13990#bib.bib61))、新颖性(Vargas and Castells 2011 (https://arxiv.org/html/2608.13990#bib.bib45))和目录覆盖率(Ge, Delgado\-Battenfeld, and Jannach 2010 (https://arxiv.org/html/2608.13990#bib.bib8))。相比之下,以用户为中心的评估考察用户的主观感知和体验,包括选择困难度(Knijnenburg et al\. 2012 (https://arxiv.org/html/2608.13990#bib.bib25))、有用性(Pu, Chen, and Hu 2011 (https://arxiv.org/html/2608.13990#bib.bib36))和满意度(Hijikata, Kai, and Nishida 2012 (https://arxiv.org/html/2608.13990#bib.bib18))。尽管先前的研究试图评估超越传统参与度指标的推荐系统,但鲜有研究定量考察推荐视频的内容深度。为解决这一差距,我们引入了列表级CDS(LCDS),第一个量化推荐列表内容深度的列表级指标。

## 3内容深度分数指标

表1:CDS的七级评分标准及其近似的理论锚点。每个级别由一个操作标准定义,以确保标注一致性。破折号表示未指定直接的理论对应关系。该标准捕捉了从情感反应到日益复杂的推理和可迁移模型构建的演进过程。

| CDS级别 | 标签 | 操作标准 | 双过程理论 | 布鲁姆分类学 | SOLO分类学 |
| :--- | :--- | :--- | :--- | :--- | :--- |
| 0 | 情感 | 主要激发情感、幽默、奇观或氛围。 | 系统1 | – | – |
| 1 | 观点 | 呈现孤立的意见或标签,不解释原因或方式。 | 系统2 | 记忆 | 前结构 |
| 2 | 概念 | 使用简单的背景或解释来定义或说明单一观点。 | 系统2 | 理解 | 单点结构 |
| 3 | 程序 | 通过具体案例(通常包括多个步骤或示例)展示方法如何使用。 | 系统2 | 应用 | 多点结构 |
| 4 | 机制 | 解释机制、变量、约束、条件、因果关系或系统关系。 | 系统2 | 分析 | 关联结构 |
| 5 | 判断 | 权衡证据或相互竞争的解释,包括局限性、不确定性或反例。 | 系统2 | 评价 | 关联结构/扩展抽象 |
| 6 | 模型 | 构建可推广的模型、框架、原则或决策规则,可在不同情境中迁移。 | 系统2 | 创造 | 扩展抽象 |

### 3\.1内容深度

为了衡量内容深度,我们首先精确定义它。

###### 定义1(内容深度)\.

视频的内容深度是指它通过解释概念、演示程序、分析机制、形成评价性判断和可推广的见解,将一个主题从孤立信息发展为结构化理解的程度。

基于定义1 (https://arxiv.org/html/2608.13990#Thmdefinition1),我们提出了CDS,第一个量化短视频内容深度的指标。当视频呈现更丰富的语义信息、更清晰的解释和更高阶的推理结构时,它会获得更高的CDS分数。内容深度在认知上是有意义的,因为更深层次的内容为观众提供了更丰富的高阶认知过程机会(Anderson and Krathwohl 2001 (https://arxiv.org/html/2608.13990#bib.bib2)),这些机会支持认知发展和智力成长。

### 3\.2七级评分标准

理论基础。我们将CDS操作化为一个基于双过程理论(Wason and Evans 1974 (https://arxiv.org/html/2608.13990#bib.bib49))、修订版布鲁姆分类学<sup>2</sup>(Anderson and Krathwohl 2001 (https://arxiv.org/html/2608.13990#bib.bib2))和SOLO分类学(Biggs and Collis 2014 (https://arxiv.org/html/2608.13990#bib.bib5))的七级标准。具体来说,双过程理论区分了即时情感处理和深思熟虑处理。布鲁姆分类学将认知过程组织为六个复杂度递增的级别,而SOLO分类学将学习者表现出的理解程度分为五个级别。基于这些互补的视角,我们使用双过程理论中的系统1来描述最低级别,使用布鲁姆分类学的六个认知级别来定义其余级别。我们进一步使用SOLO分类学作为辅助指导,以区分不同级别的理解复杂性。由此产生的标准范围从即时情感反应到日益复杂的认知过程。

标准结构。表1 (https://arxiv.org/html/2608.13990#S3.T1)展示了完整标准及其近似的理论锚点,将七个级别分为三组。低CDS组(级别0)代表主要引发情感或娱乐反应的内容,具有有限的显性知识价值。中CDS组(级别1–3)捕捉了渐进结构化的知识传递,从孤立信息到概念解释和实际应用。高CDS组(级别4–6)反映高阶认知过程,从分析推理到评价性判断以及可迁移模型或框架的开发。

详细指标和示例,连同标准的理论基础和构建过程,分别在附录A和B中提供。

## 4CDS评估基准

图2:可扩展的CDS标注工作流程概览,该流程应用了基于认知和学习理论的标准。使用一个黄金标准子集来选择与人类判断最一致的LLM评估器,以进行大规模标注。我们引入了SCOPE-Bench,这是第一个支持内容深度评估的基准...

相似文章

先思考,再打分:解耦推理与打分的视频奖励建模

Hugging Face Daily Papers

本文介绍了 DeScore,这是一种通过解耦推理和打分过程来提高训练效率和泛化能力的视频奖励模型。它利用多模态大语言模型采用“先思考再打分”的范式,解决了现有判别式和生成式奖励模型的局限性。

SVI-Bench:战略视频智能的动态微世界

Hugging Face Daily Papers

介绍了SVI-Bench,这是一个利用团队运动进行战略视频智能的大规模基准,旨在评估模型在动态场景理解、因果推理、战略模拟和代理综合方面的能力。该基准揭示了一个能力断崖:模型在感知任务上表现良好,但在更高层次的战略推理上急剧下降。