超越有效性:用于比较实际社会技术干预的多标准框架

arXiv cs.AI 论文

摘要

本文提出了一个多标准框架来评估社会技术干预,以虚假信息为案例研究,揭示了有效性、用户接受度和实施可行性之间的权衡。

arXiv:2608.20649v1 Announce Type: new 摘要:社会技术领域中的设计师和政策制定者,如内容审核、隐私界面、推荐系统等,必须在不断增长的拟议干预措施菜单中选择,但通常缺乏比较它们的原则性基础。先前的工作倾向于单独评估干预措施,主要基于有效性标准,而实施约束如成本、努力和可行性往往被单独考虑。我们提出了一个多标准框架来评估社会技术干预。该框架通过虚假信息的案例研究得以实例化,这是拟议对策高度关注的领域。我们对39名研究人员进行了调查,评估了40项可操作化的干预措施,基于五个评估标准:政治可行性、有效性、用户接受度、成本和实施努力。我们发现,专家判断最有效的干预措施并不总是公众最接受的或实施最可行的。我们还讨论了这种紧张关系对虚假信息之外的社会技术干预设计的影响,并为从业者提供了一个决策框架,以导航社会技术干预的权衡。
查看原文
查看缓存全文

缓存时间: 2026/08/24 04:18

# 比较实践社会技术干预的多标准框架  
来源:https://arxiv.org/html/2608.20649  
## 超越有效性:比较实践社会技术干预的多标准框架  
DOI:XXXXXXX.XXXXXXX(https://doi.org/XXXXXXX.XXXXXXX)  
会议:请从您的权利确认邮件中输入正确的会议标题;2018年6月3–5日;纽约州伍德斯托克  
ISBN:978-1-4503-XXXX-X/2018/06  
CCS:社会与专业主题 计算/技术政策  
CCS:以人为中心的计算 交互设计  

**作者:**  
Catherine King,Lynnette Hui Xian Ng  
**所属机构:** 卡内基梅隆大学,美国匹兹堡  
**邮箱:** [[email protected]](mailto:[email protected])  
**共同作者:** Kathleen M. Carley  
**所属机构:** 卡内基梅隆大学,美国匹兹堡  
**邮箱:** [[email protected]](mailto:[email protected])  

2018;© ,2018;收稿日期2009年6月5日  

###### 摘要  
在内容审核、隐私界面、推荐系统等社会技术领域,设计者和决策者面临日益增多的拟议干预措施选择,但通常缺乏比较这些措施的合理依据。先前的研究倾向于单独评估干预措施,且大多仅关注有效性标准,而实施约束(如成本、精力和可行性)往往被分开考虑。本文提出一个多标准框架,用于评估社会技术干预措施。该框架以虚假信息这一备受关注的领域为实例,通过调查39名研究人员对五种评估标准下40种操作化干预措施的看法展开:政治可行性、有效性、用户接受度、成本和实施投入。研究发现,专家认为最有效的干预措施并不总是公众最接受或最易于实施的。本文进一步探讨了这种矛盾对虚假信息之外的社会技术干预设计的启示,并为从业者权衡社会技术干预的取舍提供了一个决策框架。  

###### 关键词  
社会技术干预,有效性,虚假信息,专家调查  

## 1.引言  
社交媒体平台及其背后的生成式AI技术正快速改变在线信息环境,随之而来的是用于应对社会技术危害的各种干预措施(61(https://arxiv.org/html/2608.20649#bib.bib3);98(https://arxiv.org/html/2608.20649#bib.bib26);22(https://arxiv.org/html/2608.20649#bib.bib44))。然而,这些干预措施(如打击虚假信息或检测欺诈的措施)往往被单独开发和对待,而非使用一套标准化标准进行整体分析(27(https://arxiv.org/html/2608.20649#bib.bib2);41(https://arxiv.org/html/2608.20649#bib.bib13))。社会技术系统研究指出,脱离干预措施所处的社会环境,无法对其进行有意义的评估(99(https://arxiv.org/html/2608.20649#bib.bib27));价值敏感设计则要求权衡技术的多重价值(有时相互竞争),而非单一指标(33(https://arxiv.org/html/2608.20649#bib.bib28))。基于以上两条研究脉络,我们旨在建立一个全面框架,以开发在整个社交媒体领域内有效且实用的应对措施。研究人员、企业和决策者可利用该框架评估社会技术干预措施,并权衡其取舍。  

我们以虚假信息为案例,开发了一个用于社会技术干预设计的多标准框架。全文使用“干预措施”指代为降低社会技术危害而部署的有意应对措施(如政策、平台设计或教育活动)。虚假信息是一个评估差距尤为显著的领域:应对措施的涌现速度超过了该领域比较它们的能力(106(https://arxiv.org/html/2608.20649#bib.bib30);93(https://arxiv.org/html/2608.20649#bib.bib31)),且平台往往被动且不一致地实施干预措施(35(https://arxiv.org/html/2608.20649#bib.bib29))。干预设计决策通常需要在有效性和决定干预措施能否或应否部署的实际及规范考量之间进行权衡(42(https://arxiv.org/html/2608.20649#bib.bib7);95(https://arxiv.org/html/2608.20649#bib.bib9))。然而,据我们所知,目前尚无支持此类决策的框架。  

为开发该框架,我们整合了先前研究,并通过对39名研究人员的专家征询调查,评估了40种干预措施在五个标准上的表现:政治可行性、有效性、用户接受度、成本和投入水平。我们的主要研究问题是:**如何识别既实用又有效的干预措施,以及在何种条件下?** 更具体地:  
- •RQ1:当虚假信息干预措施在政治可行性、有效性、接受度、成本和投入方面被评估时,会出现哪些权衡?  
- •RQ2:哪些干预类别最能平衡以用户为中心和以实施为中心的标准?  
- •RQ3:哪些设计原则可以指导实用的虚假信息干预设计?  

本工作的贡献有三方面:  
- •首先,我们基于文献综述的协调,引入了一个包含四十种操作化干预措施的分类法。这些措施围绕八个类别构建:账户审核、内容审核、内容分发、生成式AI专项措施、内容标签、基于用户的措施、媒体素养与教育活动,以及其他外部与机构措施。  
- •其次,我们提供了这些干预措施在五个标准上的多标准专家评估:政治可行性、有效性、用户接受度、成本和实施投入。该专家征询调查显示,干预措施在有效性、接受度或政治可行性,以及所涉及的行政投入或成本方面常存在差异。  
- •第三,我们将这些判断转化为一个决策框架,该框架将实际运营约束(预算、政治风险、时间线、公众信任)映射到初始干预措施群组,以及解锁下一组干预措施所需的设计投入。  

设计者和决策者在社会技术领域常面临类似矛盾:如何审核内容(50(https://arxiv.org/html/2608.20649#bib.bib14))、为隐私选择添加多少阻力(2(https://arxiv.org/html/2608.20649#bib.bib32)),或如何监管界面设计中的暗黑模式(72(https://arxiv.org/html/2608.20649#bib.bib33))。在每种情况下,问题不在于干预措施是否有效,而在于根据具体约束应部署哪种措施。本研究以虚假信息为案例,为这一选择问题构建工具。  

本研究提供了以下洞察:探讨不同类型的干预措施在社交媒体信息环境中,针对不同实施约束的可行性,并讨论不同利益相关者如何运用此框架。  

## 2.相关工作  
### 2.1.虚假信息干预措施及其评估  
先前关于虚假信息干预措施的系统综述表明,干预措施通常按受影响的平台部分或实施主体进行分类。17(https://arxiv.org/html/2608.20649#bib.bib1)将干预措施分为四大类(信息类、教育类、社会心理类和制度类),主要基于有效性进行评估,同时建议在选择和设计干预措施时也应考虑可行性、可扩展性和持久性等维度。27(https://arxiv.org/html/2608.20649#bib.bib2)发现研究中的应对措施与平台实际实施的措施之间存在不匹配。具体而言,事实核查干预措施以及强调来源预驳斥或用户“接种”的干预措施被广泛研究,而账户级干预措施(如移除和用户通知)以及算法干预措施(如重定向和变现政策调整)仍研究不足。最后,64(https://arxiv.org/html/2608.20649#bib.bib4)将干预措施分为三大类(助推、促进与教育性干预、驳斥策略),并通过目标成果(如行为、能力和信念)及局限性来组织实施。  

尽管这三篇关键综述界定了虚假信息干预措施的范畴,但未能达到设计实践所需的比较评估。综述发现,该领域的大多数先前研究狭隘地关注干预措施的有效性或用户接受度,很少同时考察这两个维度,更鲜少考虑实施约束。我们的框架通过同时比较干预措施的多个维度来填补这一空白,以促进根据情境识别合适的干预措施。  

### 2.2.干预设计特征与权衡  
为基于多个标准设计和评估干预措施,首先需要定义其特征。一个明确的干预措施具有一组描述性的客观特征,以及可能改变用户对这些特征及干预措施整体感知的属性。干预措施的客观特征指定义其实施方式和实施主体的相对静态特征,包括实施者(哪些组织执行干预措施)、信息管道的定向阶段(如创建、传播或信念阶段)、待处理的内容、平台设计变更以及政策描述(实施和传达方式)(62(https://arxiv.org/html/2608.20649#bib.bib39))。用户感知指个人如何评估干预措施的不同客观特征,包括感知有效性、公平性、侵入性、透明度和问题认知等因素(42(https://arxiv.org/html/2608.20649#bib.bib7))。被视为更有效(收益大于成本)且获得用户更多支持(实用)的干预措施更可能被平台实施(40(https://arxiv.org/html/2608.20649#bib.bib111);61(https://arxiv.org/html/2608.20649#bib.bib3);68(https://arxiv.org/html/2608.20649#bib.bib112))。  

用户感知尤其关键,因为它影响政策支持的整体水平。这些感知影响人们是否认为问题需要干预,是否认为干预措施有效且值得实施,以及是否信任拟议的实施者公平执行新政策。公共政策支持通常取决于问题认知和待处理内容类型(42(https://arxiv.org/html/2608.20649#bib.bib7))。公众对反吸烟倡议的支持度高于酒精消费或饮食,部分原因是公众对吸烟负面后果的认知(28(https://arxiv.org/html/2608.20649#bib.bib10))。类似地,在社交媒体环境中,个人表示更愿意与亲密联系人或针对严重有害内容进行社会纠正(58(https://arxiv.org/html/2608.20649#bib.bib40);102(https://arxiv.org/html/2608.20649#bib.bib83);60(https://arxiv.org/html/2608.20649#bib.bib37))。此外,部分人可能更信任某些实施者。例如,党派性与对政府监管的支持度较低相关(108(https://arxiv.org/html/2608.20649#bib.bib21))。  

教育和信息传递活动可以改善公众对干预措施的认知和支持。一项关于公共政策干预的元分析表明,有效传达潜在政策的有效性可使总体支持率提高约4%(94(https://arxiv.org/html/2608.20649#bib.bib12))。实施更透明的干预措施也往往获得更多公众支持(42(https://arxiv.org/html/2608.20649#bib.bib7);50(https://arxiv.org/html/2608.20649#bib.bib14))。明确标记和传达的干预措施可以塑造用户对其有效性和侵入性的认知(116(https://arxiv.org/html/2608.20649#bib.bib18))。然而,更不透明的政策可能反过来不易被恶意行为者利用(50(https://arxiv.org/html/2608.20649#bib.bib14)),这体现了与透明度之间的权衡。  

### 2.3.平台设计标准的选择  
人机交互领域有大量研究探讨平台功能特性和干预设计如何塑造用户信息行为。大多数研究独立地得出相同的以权衡为中心的框架,即需要同时平衡多个标准。内容审核研究将审核视为效率、公平性和用户信任等竞争价值之间的协商,而非单一优化目标(35(https://arxiv.org/html/2608.20649#bib.bib29))。对Reddit审核工具的民族志描述将这种协商描述为平台更广泛社会技术系统的一部分,必须同时考虑自动化和人类判断(112(https://arxiv.org/html/2608.20649#bib.bib35))。类似的权衡结构也存在于隐私界面设计中,其中助推引入的阻力大小需权衡其保护效益,而非一味最大化(2(https://arxiv.org/html/2608.20649#bib.bib32))。  

具体到虚假信息领域,近期综述聚焦于有效性、可行性、可扩展性和持久性作为相关标准(17(https://arxiv.org/html/2608.20649#bib.bib1);64(https://arxiv.org/html/2608.20649#bib.bib4))。可行性指干预措施实施的难易程度及其是否符合用户预期和干预意图(41(https://arxiv.org/html/2608.20649#bib.bib13))。可扩展性和持久性均属有效性范畴,分别指干预措施扩展至更广泛受众的难易程度及其影响的持久性(47(https://arxiv.org/html/2608.20649#bib.bib15);70(https://arxiv.org/html/2608.20649#bib.bib16);86(https://arxiv.org/html/2608.20649#bib.bib17))。这些标准侧重于技术组件或用户与平台的交互,未考虑平台外部的外部影响。为此,我们转向公共政策研究。在公共政策中,比较社会技术平台监管策略时,研究通常使用有效性、行政难度或负担、成本和政治可接受性等指标评估提案(95(https://arxiv.org/html/2608.20649#bib.bib9);65(https://arxiv.org/html/2608.20649#bib.bib8);29(https://arxiv.org/html/2608.20649#bib.bib6))。公共政策视角下的行政负担与实施可行性概念相关。此外,政治可接受性类似于干预措施的用户接受度,这已被证明会影响对该干预措施的支持,尽管它也包含外部政府约束(95(https://arxiv.org/html/2608.20649#bib.bib9);61(https://arxiv.org/html/2608.20649#bib.bib3);40(https://arxiv.org/html/2608.20649#bib.bib111))。  

## 3.PEACE框架  
(翻译至此处,因原文内容截断)

相似文章

世界模型应如何评估?一种以决策为中心的立场

arXiv cs.LG

本文调研了世界模型的评估方法,主张采用以决策为中心的框架,优先考虑反事实推理、规划与策略优化,而非视觉质量。文中引入了L0–L7评估阶梯及基准协议,使评估与声称的效用一致。

评估陷阱:基准设计作为理论承诺

arXiv cs.AI

本文识别了“评估陷阱”,即人工智能基准测试无意中通过缩小“进步”的定义来稳定主导范式,并引入了Epistematics,一种元评估方法论,以确保评估标准能够区分真实能力与代理行为。