从季节性到语义:对玻利维亚路障混合概率预测系统的基准测试
摘要
本文提出了一种混合概率预测系统,将时间序列分解(Prophet)与自然语言处理技术相结合,应用于玻利维亚新闻报道以预测路障,相比纯统计模型,取得了改进的AUC-ROC和Brier分数。
arXiv:2607.21785v1 公告类型:cross
摘要:玻利维亚的路障是一种社会冲突现象,造成巨大的经济影响,估计损失相当于该国国内生产总值的4%。尽管这些事件反复发生且影响重大,但缺乏本地预测系统来为物流决策提供预期。本文提出了一种混合概率预测系统,将时间序列分解(Prophet)与自然语言处理(NLP)技术相结合,应用于六年来的玻利维亚新闻语料。该方法采用向量语义嵌入和零样本分类模型,以捕捉路障实际发生前的言论升级信号。通过使用扩展的前向滚动验证方案,覆盖1762天和七个预测视界(H+1至H+7),比较了七种内部配置和四个外部基准模型,包括SARIMA和LightGBM。结果表明,混合配置(Prophet + NLP, C6)持续优于纯统计模型,在H+1时AUC-ROC达到0.677,Brier分数相对于基线时间模型降低10.9%(0.220对比0.247),在所有评估视界上保持统计显著的误差减少(p < 0.02)。本研究验证了语义新闻信号的整合能够检测到历史惯性未能捕捉的社会紧张峰值,为关键运输走廊的风险管理提供了技术工具。
查看缓存全文
缓存时间: 2026/07/27 07:41
# 从季节性到语义:玻利维亚路障事件的混合概率预测系统基准测试 来源:https://arxiv.org/html/2607.21785 Rodrigo Vargas Sainz Universidad Privada de Santa Cruz de la Sierra [email protected] / [email protected] Christian Berón Curti Universidad Privada de Santa Cruz de la Sierra [email protected] / [email protected] ###### 摘要 玻利维亚的路障事件是一种社会冲突现象,对经济造成毁灭性影响,估计损失相当于国内生产总值的4%。尽管此类事件频发且影响巨大,但当地缺乏预测系统来预估这些事件,以便为物流决策提供依据。本文提出了一种混合概率预测系统,将时间序列分解(Prophet)与自然语言处理(NLP)技术相结合,应用于六年的玻利维亚新闻报道语料库。该方法利用向量语义嵌入和零样本分类模型,在路障实际发生前捕捉话语升级的信号。通过采用扩展滚动窗口验证方案,覆盖1762天和七个预测期(H+1至H+7),比较了七种内部配置和四种外部基准模型(包括SARIMA和LightGBM)。结果表明,混合配置(Prophet + NLP,C6)始终优于纯统计模型,在H+1期达到0.677的AUC-ROC,Brier分数相比基准时间模型降低10.9%(0.220对0.247),在所有评估预测期均保持统计显著的误差减少(p < 0.02)。本研究验证了语义新闻信号的整合能够检测历史惯性未能捕捉的社会紧张高峰,为关键运输走廊的风险管理提供了技术工具。 关键词:时间序列预测、自然语言处理、路障、玻利维亚、Prophet、XGBoost、混合模型 ###### 摘要 玻利维亚的路障事件是一种社会冲突现象,对经济造成毁灭性影响,估计损失相当于国内生产总值的4%。尽管此类事件频发且影响巨大,但当地缺乏预测系统来预估这些事件,以便为物流决策提供依据。本文提出了一种混合概率预测系统,将时间序列分解(Prophet)与自然语言处理(NLP)技术相结合,应用于六年的玻利维亚新闻报道语料库。该方法利用向量语义嵌入和零样本分类模型,在路障实际发生前捕捉话语升级的信号。通过采用扩展滚动窗口验证方案,覆盖1762天和七个预测期(H+1至H+7),比较了七种内部配置和四种外部基准模型(包括SARIMA和LightGBM)。结果表明,混合配置(Prophet + NLP,C6)始终优于纯统计模型,在H+1期达到0.677的AUC-ROC,Brier分数相比基准时间模型降低10.9%(0.220对0.247),在所有评估预测期均保持统计显著的误差减少(p < 0.02)。本研究验证了语义新闻信号的整合能够检测历史惯性未能捕捉的社会紧张高峰,为关键运输走廊的风险管理提供了技术工具。 关键词:时间序列预测、自然语言处理、路障、玻利维亚、Prophet、XGBoost、混合模型 ## 1 引言 玻利维亚的路障事件有着超越其最初作为破坏性部门谈判机制的历史轨迹。尽管路障甚至具有殖民起源,但存在更近期的记录。我们可以追溯到“水战争”(2000年)或“天然气战争”(2003年)[1 (https://arxiv.org/html/2607.21785#bib.bib1)],这些历史事件建立了一种能够重新引导国家经济政策的动员模式[2 (https://arxiv.org/html/2607.21785#bib.bib2)]。在“争取社会主义运动”(MAS)执政期间,路障经历了一个制度化过程,将非传统社会阶层在官方机构之前纳入政治辩论[3 (https://arxiv.org/html/2607.21785#bib.bib3)]。然而,近期关于这些事件的文献记录了这种工具的一个转变:从社会对话形式蜕变为社会组织或群体内部的强制手段,成为一种政治压力工具,似乎面向私人目标,并与集体诉求交织在一起[4 (https://arxiv.org/html/2607.21785#bib.bib4)]。2020–2025年间审查的研究中,有一部分将路障冲突的加剧归因于MAS内部“阿尔西斯塔”派和“埃维斯塔”派(分别支持前总统路易斯·阿尔塞·卡塔科拉和前总统埃沃·莫拉莱斯·艾马的支持群体)的分裂,其中高速公路因各种原因成为争端舞台,从对政党缩写(MAS)的控制到争夺谁来决定国家政策:政党还是政府[5 (https://arxiv.org/html/2607.21785#bib.bib5)]。这种冲突模式随着罗德里戈·帕斯·佩雷拉于2025年就任总统而加剧,他取消碳氢化合物补贴,使汽油价格上涨163%,引发全国范围内的抗议和路障浪潮[6 (https://arxiv.org/html/2607.21785#bib.bib6)]。这些事件的经济和社会影响已由各组织和新闻文章的技术报告持续记录。据估计,连续一个月的路障造成的损失相当于国内生产总值的4%[7 (https://arxiv.org/html/2607.21785#bib.bib7)]。在行业层面,国家工业报告损失数百万美元,而旅游业面临危及数千个工作岗位的危机[8 (https://arxiv.org/html/2607.21785#bib.bib8)]。社会影响包括基本食品价格因短缺而上涨多达三倍,以及因无法转运患者或供应医用氧气导致死亡的有记录案例[1 (https://arxiv.org/html/2607.21785#bib.bib1)]。政治地理学研究也确定了路障地点在特定组织势力强大的市镇(如查帕雷地区)的集中模式[9 (https://arxiv.org/html/2607.21785#bib.bib9)]。路障现象引发了关于其法律地位尚未解决的法学辩论:尽管玻利维亚国家的政治宪法承认集会和表达自由的权利,但并不支持封锁公共道路的权利。过去和现在都存在多项立法提案,例如制裁中断自由通行的法案,这些提案在分析人士之间引发了争议:一方警告将社会抗议刑事化的风险,另一方则坚持需要保障未参与冲突的公民的自由通行权[10 (https://arxiv.org/html/2607.21785#bib.bib10)]。尽管经济和社会影响如此巨大,且路障已成为一种反复发生的事件,但目前仍不存在能够以足够预见性提前预估这些事件发生、为物流和风险管理决策提供依据的预测系统——除了相关企业或组织凭直觉和阅读新闻外。虽然关于早期冲突检测的文献已经验证了文本源在高可见度背景下的效用,但在反复发生的低强度冲突场景中,其适用性仍存在分析空白。玻利维亚路障事件以地域特异性为特征,对GDELT(全球事件、语言和语调数据库)[11 (https://arxiv.org/html/2607.21785#bib.bib11)]等全球方法来说是一个无法自行解决的挑战。本研究通过开发一个混合概率预测系统来解决这一问题,该系统将时间序列分解(捕捉由社会冲突引起的路障的周期性结构)与应用于六年新闻语料库的自然语言处理技术(捕捉事件发生前话语升级的信号)相结合。通过一项消融研究,涉及七种内部配置(C1–C7)和四个独立外部基准(正则化逻辑回归、LightGBM、单变量SARIMA和带有自回归特征的XGBoost),所有模型均在1762天样本外数据的滚动窗口验证方案下评估。我们量化了新闻语义贡献是否具有统计显著性,以及这种增益是否归因于所提出的信息架构还是所使用的学习算法。本文其余部分组织如下:第2节回顾了关于使用NLP检测社会冲突和混合时间序列预测的相关文献。第3节描述了数据和提出的方法。第4节介绍了消融研究的统计显著性检验结果。第5节讨论了研究结果及其局限性。最后,第6节总结了本研究的贡献和未来研究方向。 ## 2 相关工作 社会政治不稳定的预测已逐渐从基于专家判断的方法转向由大量非结构化数据支持的早期预警系统。GDELT等全球覆盖数据库的可用性使得能够从新闻来源持续监控不稳定事件[12 (https://arxiv.org/html/2607.21785#bib.bib12)]。应用于该领域的自然语言处理已从关键词检测和图论应用发展到使用专业本体进行结构化事件提取,特别是CAMEO(冲突与调解事件观察)框架[13 (https://arxiv.org/html/2607.21785#bib.bib13)],该框架已被EMBERS等操作系统采用,能够从X社交网络、博客和数字新闻等开源信息中生成结构化警报,指定行动者、地点、时间和事件类型[14 (https://arxiv.org/html/2607.21785#bib.bib14)]。这些系统在拉丁美洲应用中报告了比传统新闻报道更具前瞻性(提前时间),但仍有记录的限制[14 (https://arxiv.org/html/2607.21785#bib.bib14)]。 先前关于从社交媒体预测内乱的工作探索了结构化事件提取的补充方法。一组研究人员提出了一种基于检测Twitter上活动级联的模型,用于预测多个拉丁美洲国家抗议活动的发生,其假设是大规模活动级联的出现构成了实际动员的可观察前兆[15 (https://arxiv.org/html/2607.21785#bib.bib15)]。Weber等人在埃及阿拉伯之春期间的Twitter数据上评估了来自抗议参与理论的预测因子,发现只有明确预示未来抗议事件的表达量增长具有显著支持,而关于社交网络上政治活动总体量的假设未发现显著证据[16 (https://arxiv.org/html/2607.21785#bib.bib16)]。另一条研究线上,Hlatshwayo和Redl使用涵盖数百个社会经济指标的指数,训练基于决策树的模型以提前一年预测动荡。他们发现,除了以往动荡历史外,食品价格通胀和移动电话普及率是最稳健的预测因子[17 (https://arxiv.org/html/2607.21785#bib.bib17)]。 最近的调查已整合大语言模型(LLMs)作为冲突动态的上下文推理机制[18 (https://arxiv.org/html/2607.21785#bib.bib18)]。类似地,ExoLLM模型将从自然语言领域学习到的表征转移到数值预测中,整合事件文本描述[19 (https://arxiv.org/html/2607.21785#bib.bib19)]。应用于冲突现象的时间序列预测文献已发现在混合架构中一致的优势,这种架构结合了统计稳健性和非线性学习能力。ARIMA-LSTM组合在这方面构成了主导架构:ARIMA组件捕获序列的线性趋势和季节结构,而长短期记忆(LSTM)网络在线性拟合的残差上进行训练,以捕获统计组件未解释的非线性动态和突然的活动峰值[20 (https://arxiv.org/html/2607.21785#bib.bib20)]。随后的工作通过动态组合机制扩展了这一原理,允许系统根据观察到的波动性制度调整每个组件的相对权重,从而优化最终预测的稳健性[21 (https://arxiv.org/html/2607.21785#bib.bib21)]。 除了纯粹内生变量外,近期模型还整合了额外的外生变量,如经济指标(食品通胀、汇率)和数字行为信号,包括使用Tor等匿名化网络作为面对即将到来的镇压时规避审查的代理,以及如前所述的社交网络上的活动级联。在分析当前关于社会冲突预测的文献时,出现两个明显趋势:第一,方法论上从单变量统计模型向混合时间分解架构的转变。尽管冲突遵循可预测的季节结构,但活动的突然峰值从根本上依赖于外生变量或季节峰值的平滑化。因此,当前系统侧重于使用稳健统计模型隔离确定性成分,同时保留自然语言处理(NLP)来建模残差和潜在强度。第二,地理不对称性:实证研究集中于英语语境或国际可见度事件,在反复发生且媒体可见度低的冲突环境中留下空白,例如玻利维亚的情况。当前文献中不存在专门应用于玻利维亚路障的系统,也没有量化新闻语义表示相对于Prophet[22 (https://arxiv.org/html/2607.21785#bib.bib22)]等时间分解模型提供的边际价值的评估,更未将此类架构与独立的机器学习和时间序列基准进行比较。本提案解决了这两个空白:它有意将时间分解的可解释性与纯编码器模型和校准梯度提升的局部精度相结合,并针对四个外部基线(正则化逻辑回归B1、LightGBM B2、单变量SARIMA B3和带有自回归特征的XGBoost B4)验证语义组件的贡献,所有模型均在相同的滚动窗口方案下进行评估,并进行了超参数优化。
相似文章
基于语义结构化分区的多元时间序列预测的重新思考
本文提出了SCPaT,一个基于Transformer的多元时间序列预测框架,它使用语义结构化分区来解决现有基于块方法的局限性,并在真实数据集上展示了有效性。
时空预测基准数据集与基线的批判性审查
本文批判性审查了时空预测的基准数据集与基线,表明经典线性模型常与图神经网络 (GNNs) 相媲美,突出了区分可靠性问题,并倡导更严格的评估。
从长新闻到精准预测:重要性感知融合与PRM引导的反思在时间序列预测中的应用
本文介绍了一个时间序列预测框架,该框架利用重要性感知的新闻压缩和过程奖励模型引导的检索,在固定上下文长度内融入长新闻文章,从而提高金融、能源、交通和比特币基准上的预测精度。
时间序列基础模型基准测试是否隐藏了依赖状态的失败?来自交通速度预测的证据
本文提出了面向时间序列基础模型的状态分层评估方法,揭示出聚合指标会掩盖交通状态转换期间的严重失败,并提出了双峰混合增强方法,在保持整体准确性的同时改善覆盖范围。
针对CTF4Science Lorenz挑战的度量感知混合预测
本文描述了一种针对CTF4Science Lorenz挑战的度量感知混合预测系统,该系统结合了神经去噪器、ODE拟合和直方图尾部分布替代,以优化九个任务对中的不同度量,在公开排行榜上取得了83.85529分的成绩。