From Seasonality to Semantics: Benchmarking a Hybrid Probabilistic Forecasting System for Roadblocks in Bolivia
Summary
This paper presents a hybrid probabilistic forecasting system that integrates time series decomposition (Prophet) with NLP techniques applied to Bolivian news coverage to predict roadblocks, achieving improved AUC-ROC and Brier Score over purely statistical models.
View Cached Full Text
Cached at: 07/27/26, 07:41 AM
# From Seasonality to Semantics: Benchmarking a Hybrid Probabilistic Forecasting System for Roadblocks in Bolivia
Source: [https://arxiv.org/html/2607.21785](https://arxiv.org/html/2607.21785)
Rodrigo Vargas SainzUniversidad Privada de Santa Cruz de la Sierra rodrigovargas@upsa\.edu\.bo/rodrivs@mit\.eduChristian Berón CurtiUniversidad Privada de Santa Cruz de la Sierra cberon@mit\.edu/cberon@gmail\.com
###### Resumen
Roadblocks in Bolivia are a social conflict phenomenon with devastating economic impacts, estimated at losses equivalent to 4 % of the national Gross Domestic Product\. Despite their recurrence and impact, there is a lack of local predictive systems to anticipate these events for logistical decision\-making\. This paper presents a hybrid probabilistic forecasting system that integrates time series decomposition \(Prophet\) with natural language processing \(NLP\) techniques applied to a six\-year corpus of Bolivian news coverage\. The methodology employs vector semantic embeddings and zero\-shot classification models to capture signals of discursive escalation prior to the materialization of the roadblocks\. Using an expanding walk\-forward validation scheme applied over 1,762 days and seven forecasting horizons \(H\+1 to H\+7\), seven internal configurations and four external benchmarks were compared, including SARIMA and LightGBM\. The results demonstrate that the hybrid configuration \(Prophet \+ NLP, C6\) consistently outperforms purely statistical models, achieving an AUC\-ROC of 0\.677 at H\+1 and reducing the Brier Score by 10\.9 % relative to the baseline temporal model \(0\.220 vs\. 0\.247\), maintaining a statistically significant error reduction across all evaluated horizons \(p<0,02p<0\{,\}02\)\. This research validates that the integration of semantic news signals allows for the detection of social tension peaks not captured by historical inertia, providing a technical tool for risk management in critical transport corridors\.
Keywords:Time series forecasting, Natural Language Processing, Roadblocks, Bolivia, Prophet, XGBoost, Hybrid models\.
###### Resumen
Los bloqueos de carreteras en Bolivia son un fenómeno de conflicto social con impactos económicos devastadores, estimados en pérdidas equivalentes al 4 % del Producto Interno Bruto nacional\. A pesar de su recurrencia e impacto, existe una carencia de sistemas predictivos locales para anticipar estos eventos en la toma de decisiones logísticas\. Este artículo presenta un sistema híbrido de pronóstico probabilístico que integra la descomposición de series temporales \(Prophet\) con técnicas de procesamiento del lenguaje natural \(NLP\) aplicadas a un corpus de seis años de cobertura periodística boliviana\. La metodología emplea embeddings semánticos vectoriales y modelos de clasificación zero\-shot para capturar señales de escalada discursiva antes de la materialización de los bloqueos\. Utilizando un esquema de validación walk\-forward de ventana expansiva aplicado a lo largo de 1,762 días y siete horizontes de pronóstico \(H\+1 a H\+7\), se compararon siete configuraciones internas y cuatro benchmarks externos, incluyendo SARIMA y LightGBM\. Los resultados demuestran que la configuración híbrida \(Prophet \+ NLP, C6\) supera de manera consistente a los modelos puramente estadísticos, alcanzando un AUC\-ROC de 0\.677 en H\+1 y reduciendo el Brier Score en un 10\.9 % en relación con el modelo temporal de referencia \(0\.220 frente a 0\.247\), manteniendo una reducción de error estadísticamente significativa en todos los horizontes evaluados \(p<0,02p<0\{,\}02\)\. Esta investigación valida que la integración de señales semánticas de noticias permite la detección de picos de tensión social no capturados por la inercia histórica, proporcionando una herramienta técnica para la gestión de riesgos en corredores de transporte críticos\.
Palabras clave:Pronóstico de series temporales, Procesamiento de Lenguaje Natural, Bloqueos de carreteras, Bolivia, Prophet, XGBoost, Modelos híbridos\.
## 1Introduction
Roadblocks in Bolivia have a historical trajectory that exceeds their original function as a disruptive sectorial negotiation mechanism\. Although roadblocks have even colonial origins, more contemporary records exist\. We could go back to the “Water War” \(2000\) or the “Gas War” \(2003\)\[[1](https://arxiv.org/html/2607.21785#bib.bib1)\], historical events that established a model of mobilization capable of reorienting economic policy in the country\[[2](https://arxiv.org/html/2607.21785#bib.bib2)\]\. During the governing period of the Movimiento al Socialismo \(MAS\), roadblocks underwent an institutionalization process that incorporated non\-traditional social sectors into the political debate before official bodies\[[3](https://arxiv.org/html/2607.21785#bib.bib3)\]\. However, recent literature regarding these events documents a transformation of this instrument: from forms of social dialogue, they have devolved into a resource for internal coercion within social organizations or populations, serving as a political pressure tool apparently oriented toward private objectives that interweave with collective demands\[[4](https://arxiv.org/html/2607.21785#bib.bib4)\]\.
A portion of the reviewed studies from the 2020–2025 period attributes the intensification of road conflict to the internal division of the MAS between the factions identified as “arcista” and “evista” \(support groups for former President Luis Arce Catacora versus support groups for former President Evo Morales Ayma\), in which highways became arenas of dispute for various reasons, ranging from the control of the party acronym \(MAS\) to the fight over who decides the country’s policies: the political party or the government\[[5](https://arxiv.org/html/2607.21785#bib.bib5)\]\. This pattern of conflict intensified with the presidential inauguration of Rodrigo Paz Pereira in 2025, whose elimination of hydrocarbon subsidies—which raised the price of gasoline by 163 %—led to a wave of protests and roadblocks on a national scale\[[6](https://arxiv.org/html/2607.21785#bib.bib6)\]\.
The economic and social impact of these episodes has been consistently documented in technical reports by various organizations and news articles\. It is estimated that one month of continuous roadblocks generates losses equivalent to 4 % of the national Gross Domestic Product\[[7](https://arxiv.org/html/2607.21785#bib.bib7)\]\. At the sectorial level, national industry reports losses of millions of dollars, while the tourism sector faces a crisis that jeopardizes thousands of jobs\[[8](https://arxiv.org/html/2607.21785#bib.bib8)\]\. Social effects include up to a tripling of basic food prices due to shortages and documented cases of mortality associated with the inability to transfer patients or supply medical oxygen\[[1](https://arxiv.org/html/2607.21785#bib.bib1)\]\. Political geography studies have also identified a pattern of territorial concentration of roadblock locations in municipalities with a strong foothold of specific organizations, such as in the Chapare region\[[9](https://arxiv.org/html/2607.21785#bib.bib9)\]\.
The phenomenon of road blockages has prompted an unresolved jurisprudence debate regarding its legal status: while the political Constitution of the Bolivian state recognizes the right to freedom of assembly and expression, it does not support a right to block public roads\. Several legislative proposals have existed and continue to exist, such as the bill proposing sanctions for the interruption of free transit, which have generated controversy between analysts who warn about the risks of criminalizing social protest and those who maintain the need to guarantee the right to free circulation for citizens not involved in the conflicts\[[10](https://arxiv.org/html/2607.21785#bib.bib10)\]\.
Despite the magnitude of this economic and social impact, and the consolidation of roadblocks as a recurring event, there are no predictive systems that allow anticipating the occurrence of these events with sufficient foresight for logistical and risk management decision\-making beyond intuition and news reading by interested companies or organizations\. Although the literature on early conflict detection has validated the utility of textual sources in high\-visibility contexts, an analytical gap remains regarding its applicability in scenarios of recurring low\-intensity conflict\. The case of road blockages in Bolivia, characterized by territorial specificity, presents a challenge that global approaches such as GDELT \(Global Database of Events, Language, and Tone\)\[[11](https://arxiv.org/html/2607.21785#bib.bib11)\]cannot resolve on their own\.
The present work addresses this through the development of a hybrid probabilistic forecasting system that combines time series decomposition \(capturing the cyclical structure of roadblocks caused by social conflicts\) with natural language processing techniques applied to a six\-year corpus of news coverage \(capturing signals of discursive escalation prior to the materialization of the events\)\. Through an ablation study of seven internal configurations \(C1–C7\) and four independent external benchmarks \(regularized logistic regression, LightGBM, univariate SARIMA, and XGBoost with autoregressive features\) evaluated under a walk\-forward validation scheme over 1,762 out\-of\-sample days, we quantify whether the semantic contribution of the press is statistically significant and whether this gain is attributable to the proposed information architecture or to the learning algorithm employed\.
The remainder of this article is organized as follows: Section 2 reviews the related literature on social conflict detection using NLP and hybrid time series forecasting\. Section 3 describes the data and the proposed methodology\. Section 4 presents the results of the ablation study and statistical significance tests\. Section 5 discusses the findings and their limitations\. Finally, Section 6 concludes with the contributions of this work and future research lines\.
## 2Related Work
The anticipation of sociopolitical instability has progressively transitioned from expert judgment\-based approaches toward early warning systems backed by large volumes of unstructured data\. The availability of global coverage databases like GDELT allows for the continuous monitoring of instability events from journalistic sources\[[12](https://arxiv.org/html/2607.21785#bib.bib12)\]\. Natural language processing applied to this domain has evolved from keyword detection and the application of Graph Theory toward the structured extraction of events using specialized ontologies, notably the CAMEO \(Conflict and Mediation Event Observations\) framework\[[13](https://arxiv.org/html/2607.21785#bib.bib13)\], adopted by operational systems like EMBERS, which are capable of generating structured alerts that specify actor, location, timing, and event type from open sources such as the X social network, blogs, and digital press\[[14](https://arxiv.org/html/2607.21785#bib.bib14)\]\. These systems have reported an anticipatory capacity \(lead time\) over traditional news coverage in Latin American applications, though documented limitations persist\[[14](https://arxiv.org/html/2607.21785#bib.bib14)\]\.
Previous work on forecasting civil unrest from social media has explored complementary approaches to structured event extraction\. A group of researchers proposed a model based on the detection of activity cascades on Twitter to predict the occurrence of protests in various Latin American countries, under the assumption that the emergence of large\-scale activity cascades constitutes an observable precursor to physical mobilization\[[15](https://arxiv.org/html/2607.21785#bib.bib15)\]\. Weber et al\. evaluated predictors derived from protest participation theory on Twitter data during the Egyptian Arab Spring, finding significant support only for the increase in the volume of expressions that explicitly anticipate future protest events, with no significant evidence for hypotheses related to the general volume of political activity on social networks\[[16](https://arxiv.org/html/2607.21785#bib.bib16)\]\. In a different line, Hlatshwayo and Redl, using an index of hundreds of socioeconomic indicators, trained decision tree\-based models to predict unrest one year in advance\. They discovered that, in addition to the history of previous unrest, food price inflation and mobile phone penetration were the most robust predictors\[[17](https://arxiv.org/html/2607.21785#bib.bib17)\]\.
Recent investigations have incorporated large language models \(LLMs\) as a contextual reasoning mechanism for conflict dynamics\[[18](https://arxiv.org/html/2607.21785#bib.bib18)\]\. Similarly, the ExoLLM model transfers representations learned from the natural language domain to numerical forecasting, integrating textual descriptions of events\[[19](https://arxiv.org/html/2607.21785#bib.bib19)\]\.
The time series forecasting literature applied to conflict phenomena has identified consistent advantages in hybrid architectures that combine statistical robustness with non\-linear learning capability\. The ARIMA\-LSTM combination constitutes the dominant architecture in this regard: the ARIMA component captures the linear trend and seasonal structure of the series, while a Long Short\-Term Memory \(LSTM\) network is trained on the residuals of the linear fit to capture non\-linear dynamics and abrupt spikes in activity unexplained by the statistical component\[[20](https://arxiv.org/html/2607.21785#bib.bib20)\]\. Subsequent works have expanded this principle through dynamic combination mechanisms that allow the system to adapt the relative weight of each component according to the observed volatility regime, optimizing the robustness of the final forecast\[[21](https://arxiv.org/html/2607.21785#bib.bib21)\]\.
Beyond purely endogenous variables, recent models incorporate additional exogenous variables such as economic indicators \(food inflation, exchange rates\) and digital behavioral signals, including the use of anonymization networks like Tor as a proxy for censorship evasion in the face of imminent repression, and activity cascades on social networks like those described previously\.
When analyzing current literature on social conflict forecasting, two clear trends emerge: First, a methodological transition away from univariate statistical models toward hybrid temporal decomposition architectures\. Although conflict follows predictable seasonal structures, abrupt spikes in activity depend fundamentally on exogenous variables or the smoothing of seasonal peaks\. Therefore, current systems focus on isolating deterministic components using robust statistical models, reserving natural language processing \(NLP\) to model residuals and latent intensities\. Second, a geographical asymmetry: empirical studies concentrate on English\-language contexts or events of international visibility, leaving a gap in environments of recurring conflict and low media visibility, as is the case in Bolivia\.
There is no existing system in the current literature applied specifically to road blockages in Bolivia, nor an evaluation that quantifies the marginal value provided by semantic press representations over temporal decomposition models like Prophet\[[22](https://arxiv.org/html/2607.21785#bib.bib22)\], nor one that compares such an architecture against independent machine learning and time series benchmarks\. The present proposal addresses both gaps: it intentionally combines the interpretability of temporal decomposition with the local precision of encoder\-only models and calibrated gradient boosting, and validates the contribution of the semantic component against four external baselines—regularized logistic regression \(B1\), LightGBM \(B2\), univariate SARIMA \(B3\), and XGBoost with autoregressive features \(B4\)—all evaluated under the same walk\-forward scheme, with hyperparameters optimized over a tuning window separate from the final evaluation period to ensure the comparison is free of model selection bias\.
## 3Data and Methodology
### 3\.1Data Sources
For this study, two independent information sources with different time horizons were integrated\. The first source is a historical archive from the Bolivian news portal which operates as a news aggregator that replicates and centralizes content produced by various national digital media outlets\. This archive contains 916,110 raw news headlines \(headlines, links, timestamps, and tags\), spanning from 2008 to 2026\. For the analysis period \(2020–2026\), the thematically filtered corpus comprises 386,884 articles distributed across 2,137 days, with an average of 181 relevant news items per day\. The remaining 517,426 articles correspond to coverage prior to 2020, a period with no road event records in the ABC, and were discarded from the evaluation window\. The second source comes from the official records of the Administradora Boliviana de Cacishared period \(2020–2026\), filtering the ABC data to exclusively include disruptions due to social conflicts in six strategic corridors for national transport \(Routes 1, 4, 5, 6, 7, and 25\)\. The aggregation of the target variable at the national level responds to an intrinsic constraint of the textual data source: more than 90 % of the press headlines omit the specific nomenclature of the road route \(e\.g\., Route 4 or Route 1\), limiting themselves to reporting the intentionality of the social conflict\. Forcing a spatial disaggregation at the route level would introduce a missing data bias and drastically reduce the statistical power of the dataset\. Therefore, the hybrid framework is formulated as a proxy for national systemic risk\.
Figura 1:Final output generated by the hybrid probabilistic forecasting system\.
### 3\.2Preprocessing and Thematic Filtering
The news corpus was cleaned in two phases\. First, the “World” category was removed due to its lack of relevance to local conflict\. Second, we applied a filter based on zero\-shot thematic classification \(detailed in Section 3\.3\) to exclude content unrelated to the phenomenon, such as sports, entertainment, horoscope, and fashion\. After this process, the resulting corpus was adjusted to 903,602 articles\.
To temporally align both sources, a dynamic cutoff criterion was adopted: the start of the time series was set one week before the first roadblock date recorded in the ABC database\. This margin ensures that the model has the necessary prior media context without including periods of inactivity that do not provide a predictive signal for the studied phenomenon\.
### 3\.3Textual Feature Extraction
Three feature extraction processes were applied to each filtered news item using pre\-trained language models:
Road relevance classification \(zero\-shot\)\.A multilingual zero\-shot classifier \(mDeBERTa\-v3\-base\-mnli\-xnli\) was used to assign each headline a continuous relevance score with respect to four levels of road conflict intensity:
– Confirmed physical roadblock \(reference weight 1\.0\)
– March or roadblock announcement \(0\.60\)
– Strike or union demand \(0\.20\)
– Unrelated content \(0\.0\)\.
Additionally, the discrete level with the highest probability \(Nivel\_Bloqueo\_ZS\) was recorded for each news item\.
Sentiment analysis\.A Spanish sentiment analysis model \(RoBERTuito, via thepysentimientolibrary\) was applied to obtain a continuous polarity score per news item\.
Vector semantic representation\.Each headline was transformed into a 384\-dimensional vector using the multilingual sentence embeddings modelparaphrase\-multilingual\-MiniLM\-L12\-v2\. A preliminary evaluation was conducted on reducing this dimensionality into a low\-dimensional latent space \(d=10d=10\) using Principal Component Analysis \(PCA\)\. However, experimental tests demonstrated a systematic degradation in the classifier’s discriminative capacity \(AUC\-ROC\), attributed to the massive loss of explained variance inherent in such an aggressive compression of dense semantic embeddings\. Consequently, it was decided to preserve the original 384 dimensions to maximize expressive capacity and safeguard the model’s decision boundaries\.
### 3\.4Weighted Daily Aggregation
Individual news items were aggregated at the daily level using a weighting scheme based on the road relevance score described in 3\.3\. For each daydd, the aggregated semantic vector was calculated as the weighted average of the embeddings of all news items published on that day, using the road relevance score as the weight when it was positive, and a differentiated residual weight \(0\.05 for news explicitly classified as irrelevant, 0\.30 for news with no zero\-shot classification available\) otherwise\. This weighting amplifies the contribution of news with content semantically related to an active road conflict compared to unrelated background media coverage\.
Additionally, the absolute volume of news, its 3\- and 7\-day moving averages, its daily variation \(delta\), and its normalized z\-score were calculated as daily variables, along with the daily average of the road relevance score \(score\_bloqueo\_diario\) and the maximum level of escalation observed in the day \(nivel\_bloqueo\_max\)\.
### 3\.5Temporal Decomposition Component
The Prophet model\[[22](https://arxiv.org/html/2607.21785#bib.bib22)\]was employed to capture the seasonal structure of the phenomenon, incorporating weekly and annual seasonality components\. To prevent temporal information leakage, a single Prophet model was fitted at each step of the walk\-forward validation scheme \(Section 3\.7\) over the history available up to the evaluation day, simultaneously generating the in\-sample fitted values \(used as a predictor variable in the training set\) and the out\-of\-sample projections for the seven evaluated forecasting horizons\.
### 3\.6Seven\-Level Ablation Architecture
In order to isolate the incremental contribution of each information source, seven experimental configurations were designed, each trained using a calibrated XGBoost classifier \(Platt scaling viaCalibratedClassifierCV\) with the following uniform hyperparameters: maximum depth of 3, learning rate of 0\.1, 50 estimators, column subsampling per tree of 0\.3 \(implicit regularization given the high dimensionality of the embeddings\), row subsampling of 0\.8, and a dynamic positive class weight \(scale\_pos\_weight\) recalculated in each training window as the ratio between negative and positive observations, to compensate for the moderate class imbalance \(historical prevalence≈\\approx38–41 %\)\.
The seven configurations were:
\-C1 \(Pure Prophet\): only the temporal decomposition projection, recalibrated using logistic regression \(Platt scaling\) on the in\-sample fitted values\.
\-C2 \(Volume\): only the press volume variables \(daily count, moving averages, delta, z\-score\)\.
\-C3 \(Pure NLP\): only the aggregated 384\-dimensional semantic vector, without the temporal or volume components\.
\-C4 \(Volume \+ Zero\-Shot \+ NLP\): integration of volume, road relevance score, and semantics, without the temporal component\.
\-C5 \(Prophet \+ Zero\-Shot\): temporal component combined with volume and road relevance score\.
\-C6 \(Prophet \+ NLP\): temporal component combined with volume and full vector semantics\.
\-C7 \(Total Hybrid\): integration of all four information sources \(temporal, volume, road relevance score, semantics\)\.
To determine whether the gain observed in configurations C5–C7 is attributable to the proposed information architecture or to the learning algorithm employed, four external benchmarks were additionally evaluated under the same walk\-forward scheme and the same horizons:
– B1 \(Regularized Logistic Regression\) C=0\.01\.
– B2 \(LightGBM\) 100 estimators, depth 3, learning rate 0\.05
– B3 \(Univariate SARIMA\) of order \(1,1,1\)×\\times\(1,1,1,7\), refitted at each step of the walk\-forward on thehubo\_bloqueoseries
– B4 \(XGBoost\) with the same features as C7 plus target lags of 1, 2, 3, and 7 days\.
The hyperparameters of B1, B2, and B4 were selected via grid search over a separate tuning window \(August 15, 2021, to December 31, 2023\), excluding the final evaluation period \(January 1, 2024, to June 11, 2026\) to avoid model selection bias\. The benchmarks receive the same features as C7, ensuring that any observed difference reflects the algorithm’s capability and not information availability\.
### 3\.7Validation Scheme: Expanding Walk\-Forward
The evaluation was conducted using an expanding window walk\-forward validation scheme, considered the methodological standard to prevent information leakage in time series forecasting problems\[[23](https://arxiv.org/html/2607.21785#bib.bib23)\]\. For each dayttof the evaluation period \(August 15, 2021, to June 11, 2026; 1,762 days\), the seven configurations were trained using exclusively information available up to dayt−1t\-1, and predictions were generated for the seven horizonst\+1t\+1tot\+7t\+7\. The forecasting target \(YY\) at each horizonhhwas constructed by shifting the binary roadblock occurrence variable, ensuring that the predictor variableinercia\_prophetused in training corresponded, for each historical observation, to the Prophet projection generated for the impact day corresponding to that horizon, exactly replicating the informational structure available at the time of actual inference\.
### 3\.8Evaluation Metrics
Four families of metrics are reported\. Discrimination: area under the ROC curve \(AUC\-ROC\)\. Calibration: Brier Score and Brier Skill Score \(BSS\) with respect to the historical climatology of the problem, defined asp\(1−p\)p\(1\-p\)whereppis the global prevalence of the positive class\. Binary classification: precision, recall, F1\-score, and log loss, calculated over the decision threshold that maximizes the F1\-score within the out\-of\-sample set for each horizon\. Statistical significance: Diebold–Mariano test \(Diebold & Mariano, 1995\) with Newey–West variance correction for multiple horizons, applied to seven paired comparisons of scientific interest, along with the effect size \(Cohen’sdd\) on the squared error differential between configurations\. Additionally, this work includes calibration curves \(reliability diagrams\) for the established configurations and benchmarks at selected horizons \(H\+1, H\+4, and H\+7\), providing the opportunity to evaluate the coherence between the emitted probabilities and the corresponding frequencies\. The interpretability of the C7 model is also examined using SHAP \(SHapley Additive exPlanations\) values, calculated on the base XGBoost classifier prior to Platt calibration, with the 384 embedding dimensions aggregated as a single group to facilitate readability\.
## 4Results and Discussion
### 4\.1Predictive Performance Evaluation
The evaluation of the seven experimental configurations under the walk\-forward validation scheme evidences a division between two groups of models\. Configurations that incorporate the temporal decomposition component \(C1, C5, C6, C7\) outperform those that do not \(C2, C3, C4\) in AUC\-ROC and Brier Score across nearly all evaluated horizons\. Within the first group, the incorporation of semantic news signals on top of the seasonal baseline \(C6: Prophet\+NLP\) produces a consistent improvement over pure Prophet \(C1\) across all seven horizons, both in discriminative capacity and probabilistic calibration\.
Figura 2:Area under the curve \(AUC\) by forecasting horizon\.The comparison between C6 and C7 \(Total Hybrid\) reveals no statistically significant difference across most horizons\. This equivalence occurs because the zero\-shot relevance score is already implicitly incorporated into C6 as the weighting mechanism during daily embedding aggregation \(Section 3\.4\)\. Consequently, adding the zero\-shot score as an explicit tabular feature in C7 provides redundant information, confirming C6 as the most parsimonious architecture\.
The evaluation of the four external benchmarks over the same walk\-forward period reveals a distinct pattern that depends on both the horizon and the metric considered\. In terms of discrimination \(AUC\-ROC\), the most competitive benchmark in H\+1 turns out to be B3 \(univariate SARIMA\), with AUC=0\.704, a value that exceeds C6 \(0\.677\) and C7 \(0\.671\) in that specific horizon\. This result reflects the strong short\-term autoregressive component in the roadblocks series: when a corridor is disrupted on day t, the probability of disruption on t\+1 is substantially higher than the base rate, a signal that SARIMA captures directly without the need for textual information\. B2 \(LightGBM trained on the same set of features as C7\) reaches AUC=0\.680 in H\+1, which is also higher than or comparable to C6, and maintains competitiveness in H\+2 \(0\.656\) and H\+3 \(0\.640\)\.
However, this advantage of the univariate and alternative benchmarks is systematically reversed as the horizon extends\. B3 drops from AUC=0\.704 in H\+1 to 0\.606 in H\+7, while C6 stands at 0\.578, and in Brier Score, C6 consistently outperforms B3 across all horizons\. Even more relevant for operational application, B3 presents the highest log loss values in the study \(see Table[14](https://arxiv.org/html/2607.21785#Ax1.T14)\), showing poor probabilistic calibration: the model emits extreme probabilities that deviate from actual frequencies, directly limiting its utility as a production alert system where the emitted probability is used to scale the logistical response\. B4 \(XGBoost with autoregressive target lags instead of semantic embeddings\) shows the weakest performance among the group of benchmarks, with AUC between 0\.462 and 0\.474 across all horizons—close to the level of chance—confirming that the temporal inertia of the target alone does not capture the signal that press embeddings provide over medium and long horizons\. B1 \(regularized Logistic Regression\) occupies an intermediate position, with AUC between 0\.589 \(H\+7\) and 0\.644 \(H\+4\), and log loss comparable to that of C5, suggesting that a linear function over the feature space captures part of the conflict pattern but lacks the ability to model non\-linear interactions exploited by C6 and C7\.
Figura 3:Brier Score by forecasting horizon\.Figura 4:Brier Skill Score \(BSS\) by forecasting horizon\.Hybrid model performance: Configurations C6 and C7 present the lowest Brier Score values \(best performance\) across most evaluated horizons \(H\+1 to H\+7\), indicating higher accuracy in probability estimation compared to the observed reality\. In particular, C6 stands out with a positive BSS that is consistently higher than C1 \(pure Prophet\), validating that the incorporation of semantic press representations adds predictive value by correcting the probabilistic estimations of the seasonal component\.
Comparison with Benchmarks: When contrasting with external models, we observe a competitive advantage for C6\. Although B3 \(SARIMA\) shows low Brier Score values in the immediate horizon \(H\+1: 0\.223\), its performance degrades rapidly as the horizon expands\. This weakness is clearly reflected in the BSS \(Table[12](https://arxiv.org/html/2607.21785#Ax1.T12)\), where C6 maintains a sustained advantage over B3, which goes from positive values in H\+1 to performance deterioration \(negative values\) starting from H\+3\. This confirms that the proposed hybrid model offers a more robust and stable probabilistic calibration for medium\-term logistical decision\-making\.
Discriminative capacity and calibration: The consistency of C6 and C7 in maintaining a positive BSS over extended horizons, compared to the volatility of purely autoregressive models \(such as B3\) or models without a temporal component \(C3 and C4\), underlines that the combination of seasonality and semantics not only improves discrimination but also optimizes the reliability of the probabilistic alerts generated by the system\.
### 4\.2Statistical Significance and Robustness of the Diebold–Mariano Test \(All Relevant Pairs\)
The Diebold–Mariano test confirms that the incorporation of the vector semantic representation \(C6\) reduces the forecasting error compared to the pure temporal decomposition model \(C1\), with p\-values below 0\.002 across the seven evaluated horizons \(Table[1](https://arxiv.org/html/2607.21785#S4.T1)\)\. The effect size \(Cohen’sdd, between−0,099\-0\{,\}099and−0,152\-0\{,\}152\) corresponds to a small magnitude according to conventional thresholds, but it is consistent and statistically robust\.
Cuadro 1:Pair C6 vs C1 — Does NLP add value over Prophet?Cuadro 2:C6 vs C3 — Does Prophet\+NLP outperform pure NLP?The contrast between C6 and C3 \(pure NLP, without a temporal component\) is informative, revealing the largest effect size in the entire study \(Cohen’sddbetween \-0\.147 and \-0\.201,p<0,0001p<0\{,\}0001across all horizons\)\. This demonstrates that the semantic press representation requires the anchoring provided by the seasonal component to constitute a useful predictive signal; on its own, this representation does not reliably discriminate between days with and without roadblocks, as confirmed by its AUC being close to or below the level of chance \(0\.44–0\.51\) across most horizons\.
Cuadro 3:C7 vs C6 — Does ZS add value over Prophet\+NLP? \[ZS RELEVANCE\]Cuadro 4:C7 vs B1 — Does the hybrid outperform Logistic Regression? \[LINEAR BENCHMARK\]Cuadro 5:C7 vs B2 — Does the hybrid outperform the equivalent LightGBM? \[ALT\. GBM BENCHMARK\]Cuadro 6:C7 vs B3 — Does the hybrid outperform univariate SARIMA? \[ARIMA BENCHMARK\]Cuadro 7:C7 vs B4 — Does NLP add value over Lag Features\+XGBoost? \[AUTOREGRESSIVE BENCHMARK\]The Diebold–Mariano tests against the four external benchmarks \(Tables[4](https://arxiv.org/html/2607.21785#S4.T4)–[7](https://arxiv.org/html/2607.21785#S4.T7)\) directly address whether the superiority of C7 over C1 is attributable to the proposed information architecture or to the learning algorithm employed\. Against B2 \(LightGBM trained on the same set of features as C7\), the DM test yields significant values across all seven horizons \(p<0,05p<0\{,\}05in all cases,p<0,01p<0\{,\}01in most\), ruling out that the observed gain of C7 over C1 can be explained by an inherent advantage of the XGBoost algorithm over other gradient boosting methods: when the information set is identical, XGBoost calibrated with temporal decomposition consistently outperforms LightGBM\. The comparison against B4 \(XGBoost with autoregressive target lags instead of semantic embeddings\) is also significant from H\+1 to H\+6, with Cohen’sddbetween−0,08\-0\{,\}08and−0,15\-0\{,\}15, confirming that the semantic signal extracted from press embeddings provides information not captured by the mere temporal inertia of the target expressed as direct lags\.
Against B1 \(Logistic Regression\) and B3 \(SARIMA\), the pattern is more nuanced\. C7 significantly outperforms B1 in H\+1 and H\+2 \(p<0,05p<0\{,\}05\), but the difference does not reach statistical significance in H\+3 to H\+7, which is consistent with the competitiveness of B1 in F1\-score over medium horizons observed in the experiments\. Against B3 \(SARIMA\), C7 shows a significant advantage in H\+3 to H\+7 but not in H\+1, where the immediate autoregressive component favors the univariate model—a finding consistent with the higher AUC of B3 in that specific horizon already discussed in Section 4\.1\. Taken together, these results suggest that the contribution of the semantic component is more robust against gradient boosting alternatives than against purely temporal models in short horizons, and that the advantage of the proposed hybrid system consolidates from H\+3 onward, where the seasonal structure of Prophet combined with the semantic signal from the press captures information that univariate benchmarks cannot represent\.
Cuadro 8:Longest streak without roadblocks: 41 days\. Period: November 15 to December 25, 2024 \(objective criterion: maximum consecutive streak free in the historical data\)As a sanity check to verify logical discriminative consistency, the system’s performance was evaluated using the class probability separation margin, defined asΔP=P\(Blocked\)−P\(Free\)\\Delta P=P\(\\text\{Blocked\}\)\-P\(\\text\{Free\}\)\. A valid probabilistic forecasting model must satisfyΔP\>0\\Delta P\>0, ensuring it assigns systematically higher risk probabilities to actual roadblock events than to free days\.
The system’s behavior during prolonged periods of social calm was evaluated over the longest streak of consecutive days without roadblocks recorded in the historical data \(41 days, spanning November and December 2024\)\. Within this specific test window, temporally anchored configurations \(C1C1,C5C5,C6C6,C7C7\) consistently maintain positive separation across all evaluated horizons \(H\+1H\+1,H\+3H\+3,H\+7H\+7\)\. This confirms that their discriminative capacity does not rely exclusively on the historical prevalence of the positive class\. In particular, the proposed architecture \(C6C6\) maintains stable positive margins \(\+0,088\+0\{,\}088atH\+1H\+1,\+0,050\+0\{,\}050atH\+3H\+3, and\+0,029\+0\{,\}029atH\+7H\+7\), proving that its signal stems from genuine pre\-conflict dynamics rather than false alarms during calm periods\.
In contrast, naive NLP\-only and improperly integrated hybrid setups \(C2–C4C2\\text\{\-\-\}C4\), along with the persistent baseline \(B4B4\), fail this sanity check\. ConfigurationsC3C3andC4C4exhibit negative separation atH\+3H\+3andH\+7H\+7\(reaching−0,014\-0\{,\}014forC3C3atH\+7H\+7\), erroneously assigning on average a higher probability to effectively free days than to days with roadblocks within this window—further evidence of their limited discriminative capacity in the absence of the temporal component\. Furthermore, while tree\-based benchmarks \(B2B2,B3B3\) display larger raw separation atH\+1H\+1due to extreme probability estimates near0and11, this overconfidence leads to severe calibration degradation over extended horizons\. ConfigurationC6C6strikes the optimal balance between robust class separation and long\-term probabilistic calibration\.
Figura 5:Separation capacity of the distinct configurations between roadblock days and free days\.
### 4\.3Classification and Calibration Metrics
The analysis of the confusion matrix and derived classification metrics \(Section 6D\) confirms the same pattern observed in the probabilistic metrics: configurations C3, C4, and, to a lesser extent, C2 tend to collapse toward an almost uniform prediction of the positive class across multiple horizons \(recall close to 1\.0 with specificity close to 0\), a behavior consistent with the absence of a real discriminative signal rather than effective classifier performance\. In contrast, configurations C5, C6, and C7 exhibit confusion matrices with substantial representation across all four classification categories, achieving the highest F1\-score values in the study \(C6: 0\.583–0\.617\) under the optimal decision threshold determined on the out\-of\-sample set for each horizon\.
### 4\.4Operational Risk Radar: Application Case Study
As an operational validation exercise, the system was run on the week of June 12 to 18, 2026, generating out\-of\-sample forecasts for the seven evaluated horizons\. Configuration C6 projected roadblock probabilities substantially higher than the base rate of the last 365 days \(30\.7 %\) across the entirety of the analyzed horizon, reaching “High Risk” according to the 80th percentile threshold of the historical distribution of predictions on all days except H\+7\. Noteworthy is the divergence between the C6 projection and that of the isolated calibrated Prophet component \(C1\), which in horizons H\+2 and H\+3 projected probabilities below the base rate \(18\.97 % and 14\.54 %, respectively\) in contrast to the probabilities above 70 % emitted by C6\. This divergence illustrates the mechanism proposed in this work: the incorporation of semantic press signals allows the system to detect escalations in social tension not captured by the pure seasonal structure, whose behavior is rigorously validated by monitoring the actual materialization of these forecasts in subsequent days\.
Cuadro 9:Weekly Roadblock Risk
HIGH RISK = High risk; MODERATE RISK = Moderate risk\.
![[Uncaptioned image]](https://arxiv.org/html/2607.21785v1/x1.png)Figura 6:Weekly operational risk on critical routes according to configurations C6 and C7\.Although B3 \(SARIMA\) and B2 \(LightGBM\) exhibit competitive or superior AUC compared to C6 in H\+1, their selection as an operational system is discouraged for two reasons: B3 presents the poorest probabilistic calibration in the study \(log loss 0\.80–0\.86\), which limits the interpretability of its probabilities as actionable risk measures; and both models show consistent degradation from horizon H\+3 onward, while C6 maintains a lower Brier Score across all seven horizons\. The operational radar presented in Figure 4 utilizes C6 as the primary configuration precisely due to this combination of probabilistic calibration and multi\-horizon consistency\.
A key aspect for the operational implementation of the system is decision threshold management\. The Precision\-Recall curves \(Figure[7](https://arxiv.org/html/2607.21785#S4.F7)\) illustrate the trade\-off available in horizons H\+1, H\+4, and H\+7\. In H\+1, C6 \(Average Precision=0\.599\) consistently outperforms C1 \(AP=0\.517\) across the entire Precision\-Recall space: under the threshold optimized for F1 \(0\.39\), C6 detects 78 % of actual roadblocks with a precision of 51 %, whereas raising the threshold to 0\.60 yields a precision of 66 % at the cost of reducing recall to 20 %—operationally useful for high fixed\-cost decisions such as heavy cargo rerouting\. In H\+4, the advantage of C6 \(AP=0\.525\) over C1 \(AP=0\.501\) is maintained, though reduced, with both curves converging in the medium recall range\. In H\+7, C1 \(AP=0\.495\) recovers a slight advantage over C6 \(AP=0\.474\) in binary discrimination, a result consistent with Prophet’s competitiveness in AUC at that horizon—although C6 retains its superiority in Brier Score, confirming that the advantage of the semantic component shifts from discrimination toward probabilistic calibration as the horizon extends\. The calibration of C6 is precisely what enables this threshold adjustment: a poorly calibrated model cannot offer such a decision surface, regardless of its AUC\.
Figura 7:Precision\-Recall curves C6 vs C1 \(H\+1, H\+4, H\+7\)\.
## 5Discussion and Limitations
This work demonstrates that the integration of semantic news analysis provides a statistically significant improvement over models configured purely with temporal components \(C6 vs\. C1\)\. Roadblock conflicts in Bolivia exhibit a strong seasonal structure captured by baseline time\-series models; however, the addition of dense vector embeddings in C6 smooths out false seasonal peaks while providing an overall structural balance to the forecasts\. The superior performance of C6 relative to the remaining internal configurations \(C1–C5\) and external baselines \(B1–B4\) confirms that its predictive value stems from the complementary interplay between temporal inertia and semantic signals\. Notably, comparing configuration C6 to C7 \(which explicitly incorporates zero\-shot classification scores\) reveals that adding explicit zero\-shot metrics introduces redundant information\. The dense vector embeddings already capture sufficient semantic relevance without requiring additional explicit categorization, validating C6 as the most parsimonious and effective hybrid architecture\.
Despite these positive empirical findings, several methodological, temporal, and spatial limitations must be acknowledged:
Spatial Resolution and Corridor Granularity: While the model offers robust risk estimates for the primary Bolivian road network—specifically covering critical transport corridors such as Routes 1,4, 5, 6, 7, and 25—it currently treats all critical routes as a single aggregated target\. This macro\-level approach introduces a spatial dilution bias, as conflict dynamics in regions like the Chapare differ fundamentally from those in Santa Cruz, Potosí, or La Paz\. Disaggregating these critical routes into specific geographic segments will be essential in future iterations to deliver more granular and location\-specific alerts\.
Media Aggregator Bias: The textual dataset relies exclusively on the bolivian news aggregator portal\. Consequently, the system operates under the potential partiality and editorial framing inherent to this specific outlet\. The model effectively captures social conflict as filtered and reported by this portal rather than representing an absolute ground truth of social unrest\. Benchmarking against multi\-source media feeds will be required to quantify and mitigate single\-aggregator bias\.
Reporting Latency and Real\-Time Agility: Although the expanding walk\-forward validation scheme strictly prevents data leakage \(Xt→Yt\+hX\_\{t\}\\to Y\_\{t\+h\}\), the inherent latency of journalistic data can constrain immediate response agility\. News articles published on dayttmay describe sudden, unannounced emergency blockades that materialized earlier the same morning\. While the system excels at predicting multi\-day conflict escalation horizons, intraday reporting delays limit its utility for real\-time emergency rerouting during spontaneous events\.
Domain Adaptation, Local Idioms, and Political Regime Shifts: The processing of embeddings relies on general pre\-trained language models that may not fully capture local idiomatic expressions, colloquialisms, or jargon specific to the Bolivian press\. Furthermore, media discourse undergoes shifting semantics during political transitions, such as the establishment of the new government at the end of 2025\. Implementing periodic fine\-tuning and continuous domain adaptation represents a critical avenue to maintain a reliable semantic signal across evolving political landscapes\.
Socio\-Political and Ethical Considerations: Roadblocks in Bolivia are complex human phenomena rooted in power dynamics, collective identity, and structural demands, often preceded by unrecorded local assemblies or union negotiations\. Machine learning models capture discursive escalation in media but cannot comprehend the underlying socio\-political causes\. Crucially, this predictive system is designed strictly as a logistical decision\-support tool for supply chain resilience and transport safety; it should not be used to criminalize social protest or substitute for constructive political dialogue\.
## 6Conclusions
This research validated the viability and superiority of a hybrid framework for forecasting and early detection of roadblocks on critical transport routes in Bolivia\. The statistical robustness of temporal models was integrated with the necessary context derived from news headlines\. Through a walk\-forward framework spanning approximately 1,700 days, it was demonstrated that incorporating vector semantic representation and analysis \(C6\) consistently outperforms univariate statistical models or pure machine learning approaches\.
The fundamental contributions of this work are threefold:
It was verified that the predictive value does not reside solely in a seasonal configuration; rather, the semantic and hybrid contribution sustains itself over medium\-term horizons, unlike autoregressive models\.
Vector representations efficiently capture the intensity and nuances of conflict without the need for explicit categorization\. This optimizes the operational efficiency of the system by reducing additional processing\.
## Referencias
- \[1\]M\. Gaja, “Bolivia actual: la acción del movimiento indígena”, Itiner\. Rev\. Estud\. Lingüisticos Lit\. Históricos Antropológicos, n\.o 6, pp\. 297–312\.
- \[2\]R\. Tellería, “Bloqueos: ¿derecho, instrumento de lucha o instrumento político?”, Los Tiempos, 26 de enero de 2026\.
- \[3\]M\. C\. Zeballos Puccherelli, “Grupos de presión\. Caracterización analítica de la acción colectiva de sectores sociales en la conflictividad boliviana”, Crítica Resist\. Rev\. Confl\. Soc\. Latinoam\., n\.o 19, pp\. 166–197, dic\. 2024\.
- \[4\]M\. S\. Trigo, “Bloqueos, enfrentamientos y muertes: cinco puntos para entender lo que está pasando en Bolivia”, Infobae, 15 de junio de 2025\.
- \[5\]F\. Molina, “Evistas versus arcistas\. Guerra abierta en el MAS boliviano”, Nueva Sociedad, n\.o 307, Friedrich Ebert Stiftung, Buenos Aires, Argentina, pp\. 4–13, septiembre de 2023\.
- \[6\]J\. P\. Marca y M\. M\. Noriega Villagómez, “Bolivia”, Décimo Inf\. Acceso Tierra Territ\. En Sudamérica, n\.o 10, pp\. 89–116, dic\. 2025\.
- \[7\]Economy, “Conflictos y bloqueos dejaron un impacto económico equivalente al 4 % del PIB”, junio de 2026\. \[En línea\]\. Disponible en:[https://www\.economy\.com\.bo/articulo/economia/conflictos\-bloqueos\-dejaron\-impacto\-economico\-equivalente\-4\-pib/20260601172554022699\.html](https://www.economy.com.bo/articulo/economia/conflictos-bloqueos-dejaron-impacto-economico-equivalente-4-pib/20260601172554022699.html)
- \[8\]El Deber, “Bloqueos golpean al turismo: hoteles registran hasta 90 % de cancelaciones y pérdidas superan los $us 200 millones”, 12 de junio de 2026\. \[En línea\]\. Disponible en:[https://eldeber\.com\.bo/economia/bloqueos\-golpean\-turismo\-hoteles\-registran\-90\-cancelaciones\-perdidas\-superan\-us\-200\-millones\_1781318488](https://eldeber.com.bo/economia/bloqueos-golpean-turismo-hoteles-registran-90-cancelaciones-perdidas-superan-us-200-millones_1781318488)
- \[9\]R\. F\. Molina Rodriguez, “Geografía del conflicto: Análisis de bloqueos en la red vial fundamental a partir de datos abiertos”, Rev\. Boliv\. Investig\. Geográficas, vol\. 1, n\.o 1, jun\. 2025, \[En línea\]\. Disponible en:[https://ojs\.umsa\.bo/index\.php/revigeo](https://ojs.umsa.bo/index.php/revigeo)
- \[10\]M\. V\. Fernández Ovando, J\. Chocata Gomez, P\. E\. Apaza Marce, y O\. C\. Siles Garcia, “Propuesta y análisis de implementación de sanciones penales para los responsables de bloqueos de carreteras en Bolivia”, Cienc\. Lat\. Int\., vol\. 8, n\.o 5, pp\. 2–23, oct\. 2024\.
- \[11\]GDELPROJECT, “GDELPROJECT”\. \[En línea\]\. Disponible en:[https://www\.gdeltproject\.org/solutions\.html](https://www.gdeltproject.org/solutions.html)
- \[12\]D\. Hong, Z\. Fu, X\. Zhang, y Y\. Pan, “Research on the Development and Application of the GDELT Event Database”, Data, vol\. 10, n\.o 10, p\. 158, oct\. 2025, doi: 10\.3390/data10100158\.
- \[13\]D\. Gerner J\., R\. Jabr, y P\. A\. Schrodt, “Conflict and Mediation Event Observations \(CAMEO\): A New Event Data Framework for the Analysis of Foreign Policy Interactions”\. \[En línea\]\. Disponible en:[https://www\.researchgate\.net/publication/2840364\_Conflict\_and\_Mediation\_Event\_Observations\_CAMEO\_A\_New\_Event\_Data\_Framework\_for\_the\_Analysis\_of\_Foreign\_Policy\_Interactions\#references](https://www.researchgate.net/publication/2840364_Conflict_and_Mediation_Event_Observations_CAMEO_A_New_Event_Data_Framework_for_the_Analysis_of_Foreign_Policy_Interactions#references)
- \[14\]N\. Ramakrishnan et al\., “Beating the news” with EMBERS: Forecasting Civil Unrest using Open Source Indicators”, 2014, arXiv\. doi: 10\.48550/ARXIV\.1402\.7035\.
- \[15\]J\. Cadena, G\. Korkmaz, C\. J\. Kuhlman, A\. Marathe, N\. Ramakrishnan, y A\. Vullikanti, “Forecasting Social Unrest Using Activity Cascades”, PLOS ONE, vol\. 10, n\.o 6, p\. e0128879, jun\. 2015, doi: 10\.1371/journal\.pone\.0128879\.
- \[16\]I\. Weber, V\. R\. K\. Garimella, y A\. Batayneh, “Secular vs\. Islamist polarization in Egypt on Twitter”, en Proceedings of the 2013 IEEE/ACM International Conference on Advances in Social Networks Analysis and Mining, Niagara Ontario Canada: ACM, ago\. 2013, pp\. 290–297\. doi: 10\.1145/2492517\.2492557\.
- \[17\]S\. Hlatshwayo y C\. Redl, “Forecasting Social Unrest: A Machine Learning Approach”, IMF Work\. Pap\., vol\. 2021, n\.o 263, p\. 1, nov\. 2021, doi: 10\.5089/9781557758873\.001\.
- \[18\]S\. Yao et al\., “ReAct: Synergizing Reasoning and Acting in Language Models”, 10 de marzo de 2023, arXiv: arXiv:2210\.03629\. doi: 10\.48550/arXiv\.2210\.03629\.
- \[19\]Q\. Huang, Z\. Zhou, K\. Yang, y Y\. Wang, “Exploiting Language Power for Time Series Forecasting with Exogenous Variables”, en Proceedings of the ACM on Web Conference 2025, Sydney NSW Australia: ACM, abr\. 2025, pp\. 4043–4052\. doi: 10\.1145/3696410\.3714793\.
- \[20\]G\. P\. Zhang, “Time series forecasting using a hybrid ARIMA and neural network model”, Neurocomputing, vol\. 50, pp\. 159–175, ene\. 2003, doi:[https://doi\.org/10\.1016/S0925\-2312\(01\)00702\-0](https://doi.org/10.1016/S0925-2312(01)00702-0)\.
- \[21\]G\. Elliott, Ed\., “Handbook of economic forecasting\. 1”, 1\. ed\., en Handbooks in economics, no\. 24,1\., Amsterdam: Elsevier, 2006\.
- \[22\]S\. J\. Taylor y B\. Letham, “Forecasting at scale”, 27 de septiembre de 2017, PeerJ Preprints\. doi: 10\.7287/peerj\.preprints\.3190v2\.
- \[23\]R\. J\. Hyndman y G\. Athanasopoulos, “Forecasting: Principles and Practice”\. \[En línea\]\. Disponible en:[https://otexts\.com/fpp3/](https://otexts.com/fpp3/)
## Supplementary Material
Cuadro 10:Area Under the Curve \(AUC\)Cuadro 11:Brier ScoreCuadro 12:BSS ScoreCuadro 13:F1\-score Summary \(Overall\)Cuadro 14:Log Loss Summary \(Overall\)### Confusion Matrix and Classification Metrics — C1–C7
Optimal threshold: maximizes F1 on the OOS set for horizon H\+1
Cuadro 15:Table H\+1Cuadro 16:Table H\+2Cuadro 17:Table H\+3Cuadro 18:Table H\+4Cuadro 19:Table H\+5Cuadro 20:Table H\+6Cuadro 21:Table H\+7
De la estacionalidad a la semántica: benchmarking de un sistema híbrido de predicción probabilística para bloqueos de vías en Bolivia
Rodrigo Vargas Sainz
Universidad Privada de Santa Cruz de la Sierra rodrigovargas@upsa\.edu\.bo/rodrivs@mit\.edu
Christian Berón Curti
Universidad Privada de Santa Cruz de la Sierra cberon@mit\.edu/cberon@gmail\.com
## Apéndice AIntroducción
Los bloqueos de carreteras en Bolivia tienen una trayectoria histórica que excede su función original como un mecanismo disruptivo de negociación sectorial\. Aunque los bloqueos tienen incluso orígenes coloniales, existen registros más contemporáneos\. Podríamos remontarnos a la “Guerra del Agua” \(2000\) o la “Guerra del Gas” \(2003\)\[[1](https://arxiv.org/html/2607.21785#bib.bib1)\], eventos históricos que establecieron un modelo de movilización capaz de reorientar la política económica en el país\[[2](https://arxiv.org/html/2607.21785#bib.bib2)\]\. Durante el período de gobierno del Movimiento al Socialismo \(MAS\), los bloqueos experimentaron un proceso de institucionalización que incorporó a sectores sociales no tradicionales en el debate político ante organismos oficiales\[[3](https://arxiv.org/html/2607.21785#bib.bib3)\]\. Sin embargo, la literatura reciente respecto a estos eventos documenta una transformación de este instrumento: de formas de diálogo social, han degenerado en un recurso de coacción interna dentro de las organizaciones sociales o poblaciones, sirviendo como una herramienta de presión política aparentemente orientada hacia objetivos privados que se entrelazan con demandas colectivas\[[4](https://arxiv.org/html/2607.21785#bib.bib4)\]\.
Una parte de los estudios revisados del período 2020–2025 atribuye la intensificación de los conflictos viales a la división interna del MAS entre las facciones identificadas como “arcista” y “evista” \(grupos de apoyo al expresidente Luis Arce Catacora versus grupos de apoyo al expresidente Evo Morales Ayma\), en las que las carreteras se convirtieron en arenas de disputa por diversas razones, que van desde el control de la sigla partidaria \(MAS\) hasta la pugna sobre quién decide las políticas del país: el partido político o el gobierno\[[5](https://arxiv.org/html/2607.21785#bib.bib5)\]\. Este patrón de conflicto se intensificó con la posesión presidencial de Rodrigo Paz Pereira en 2025, cuya eliminación de los subsidios a los hidrocarburos —que elevó el precio de la gasolina en un 163 %— provocó una ola de protestas y bloqueos a escala nacional\[[6](https://arxiv.org/html/2607.21785#bib.bib6)\]\.
El impacto económico y social de estos episodios ha sido documentado de manera consistente en informes técnicos de diversas organizaciones y artículos periodísticos\. Se estima que un mes de bloqueos continuos genera pérdidas equivalentes al 4 % del Producto Interno Bruto nacional\[[7](https://arxiv.org/html/2607.21785#bib.bib7)\]\. A nivel sectorial, la industria nacional reporta pérdidas millonarias, mientras que el sector turístico enfrenta una crisis que pone en riesgo miles de empleos\[[8](https://arxiv.org/html/2607.21785#bib.bib8)\]\. Los efectos sociales incluyen hasta la triplicación de los precios de los alimentos básicos debido al desabastecimiento y casos documentados de mortalidad asociados a la imposibilidad de trasladar pacientes o suministrar oxígeno médico\[[1](https://arxiv.org/html/2607.21785#bib.bib1)\]\. Los estudios de geografía política también han identificado un patrón de concentración territorial de los puntos de bloqueo en municipios con una fuerte presencia de organizaciones específicas, como en la región del Chapare\[[9](https://arxiv.org/html/2607.21785#bib.bib9)\]\.
El fenómeno de los bloqueos de carreteras ha impulsado un debate jurisprudencial no resuelto respecto a su estatus legal: si bien la Constitución Política del Estado boliviano reconoce el derecho a la libertad de reunión y de expresión, no respalda el derecho a bloquear las vías públicas\. Han existido y continúan existiendo diversas propuestas legislativas, como el proyecto de ley que propone sanciones por la interrupción del libre tránsito, las cuales han generado controversia entre analistas que advierten sobre los riesgos de criminalizar la protesta social y aquellos que sostienen la necesidad de garantizar el derecho a la libre circulación de los ciudadanos no involucrados en los conflictos\[[10](https://arxiv.org/html/2607.21785#bib.bib10)\]\.
A pesar de la magnitud de este impacto económico y social, y de la consolidación de los bloqueos como un evento recurrente, no existen sistemas predictivos que permitan anticipar la ocurrencia de estos eventos con la suficiente antelación para la toma de decisiones logísticas y de gestión de riesgos más allá de la intuición y la lectura de noticias por parte de empresas u organizaciones interesadas\. Aunque la literatura sobre detección temprana de conflictos ha validado la utilidad de las fuentes textuales en contextos de alta visibilidad, persiste una brecha analítica con respecto a su aplicabilidad en escenarios de conflicto recurrente de baja intensidad\. El caso de los bloqueos de carreteras en Bolivia, caracterizado por su especificidad territorial, presenta un desafío que los enfoques globales como GDELT \(Global Database of Events, Language, and Tone\)\[[11](https://arxiv.org/html/2607.21785#bib.bib11)\]no pueden resolver por sí solos\.
El presente trabajo aborda esta problemática mediante el desarrollo de un sistema híbrido de pronóstico probabilístico que combina la descomposición de series temporales \(capturando la estructura cíclica de los bloqueos causados por conflictos sociales\) con técnicas de procesamiento del lenguaje natural aplicadas a un corpus de seis años de cobertura periodística \(capturando señales de escalada discursiva previas a la materialización de los eventos\)\. A través de un estudio de ablación de siete configuraciones internas \(C1–C7\) y cuatro benchmarks externos independientes \(regresión logística regularizada, LightGBM, SARIMA univariado y XGBoost con características autorregresivas\) evaluados bajo un esquema de validación walk\-forward durante 1,762 días fuera de muestra, cuantificamos si la contribución semántica de la prensa es estadísticamente significativa y si esta ganancia es atribuible a la arquitectura de información propuesta o al algoritmo de aprendizaje empleado\.
El resto de este artículo se organiza de la siguiente manera: la Sección 2 revisa la literatura relacionada sobre la detección de conflictos sociales mediante NLP y el pronóstico híbrido de series temporales\. La Sección 3 describe los datos y la metodología propuesta\. La Sección 4 presenta los resultados del estudio de ablación y las pruebas de significancia estadística\. La Sección 5 discute los hallazgos y sus limitaciones\. Finalmente, la Sección 6 concluye con las contribuciones de este trabajo y las líneas de investigación futuras\.
## Apéndice BTrabajo Relacionado
La anticipación de la inestabilidad sociopolítica ha pasado progresivamente de enfoques basados en el juicio de expertos hacia sistemas de alerta temprana respaldados por grandes volúmenes de datos no estructurados\. La disponibilidad de bases de datos de cobertura global como GDELT permite el monitoreo continuo de eventos de inestabilidad a partir de fuentes periodísticas\[[12](https://arxiv.org/html/2607.21785#bib.bib12)\]\. El procesamiento del lenguaje natural aplicado a este dominio ha evolucionado desde la detección de palabras clave y la aplicación de la Teoría de Grafos hacia la extracción estructurada de eventos mediante ontologías especializadas, destacando el marco CAMEO \(Conflict and Mediation Event Observations\)\[[13](https://arxiv.org/html/2607.21785#bib.bib13)\], adoptado por sistemas operacionales como EMBERS, los cuales son capaces de generar alertas estructuradas que especifican el actor, la ubicación, la temporalidad y el tipo de evento a partir de fuentes abiertas como la red social X, blogs y prensa digital\[[14](https://arxiv.org/html/2607.21785#bib.bib14)\]\. Estos sistemas han reportado una capacidad de anticipación \(tiempo de antelación\) superior a la cobertura de noticias tradicional en aplicaciones de América Latina, aunque persisten limitaciones documentadas\[[14](https://arxiv.org/html/2607.21785#bib.bib14)\]\.
Trabajos previos sobre la predicción del malestar civil a partir de redes sociales han explorado enfoques complementarios a la extracción estructurada de eventos\. Un grupo de investigadores propuso un modelo basado en la detección de cascadas de actividad en Twitter para predecir la ocurrencia de protestas en varios países de América Latina, bajo el supuesto de que el surgimiento de cascadas de actividad a gran escala constituye un precursor observable de la movilización física\[[15](https://arxiv.org/html/2607.21785#bib.bib15)\]\. Weber et al\. evaluaron predictores derivados de la teoría de participación en protestas utilizando datos de Twitter durante la Primavera Árabe egipcia, encontrando respaldo significativo únicamente para el incremento en el volumen de expresiones que anticipan explícitamente eventos de protesta futuros, sin evidencia significativa para las hipótesis relacionadas con el volumen general de actividad política en redes sociales\[[16](https://arxiv.org/html/2607.21785#bib.bib16)\]\. En una línea diferente, Hlatshwayo y Redl, utilizando un índice de cientos de indicadores socioeconómicos, entrenaron modelos basados en árboles de decisión para predecir disturbios con un año de anticipación\. Descubrieron que, además del historial de disturbios previos, la inflación de los precios de los alimentos y la penetración de la telefonía móvil eran los predictores más robustos\[[17](https://arxiv.org/html/2607.21785#bib.bib17)\]\.
Investigaciones recientes han incorporado modelos de lenguaje de gran tamaño \(LLM\) como un mecanismo de razonamiento contextual para la dinámica de conflictos\[[18](https://arxiv.org/html/2607.21785#bib.bib18)\]\. De manera similar, el modelo ExoLLM transfiere representaciones aprendidas del dominio del lenguaje natural al pronóstico numérico, integrando descripciones textuales de los eventos\[[19](https://arxiv.org/html/2607.21785#bib.bib19)\]\.
La literatura sobre pronóstico de series temporales aplicada a fenómenos de conflicto ha identificado ventajas consistentes en arquitecturas híbridas que combinan la robustez estadística con la capacidad de aprendizaje no lineal\. La combinación ARIMA\-LSTM constituye la arquitectura dominante en este aspecto: el componente ARIMA captura la tendencia lineal y la estructura estacional de la serie, mientras que una red de Memoria a Corto y Largo Plazo \(LSTM\) se entrena con los residuos del ajuste lineal para capturar dinámicas no lineales y picos abruptos de actividad no explicados por el componente estadístico\[[20](https://arxiv.org/html/2607.21785#bib.bib20)\]\. Trabajos posteriores han expandido este principio mediante mecanismos de combinación dinámica que permiten al sistema adaptar el peso relativo de cada componente según el régimen de volatilidad observado, optimizando la robustez del pronóstico final\[[21](https://arxiv.org/html/2607.21785#bib.bib21)\]\.
Más allá de las variables puramente endógenas, los modelos recientes incorporan variables exógenas adicionales, tales como indicadores económicos \(inflación de alimentos, tipos de cambio\) y señales de comportamiento digital, incluyendo el uso de redes de anonimización como Tor como proxy para la evasión de la censura ante una represión inminente, así como cascadas de actividad en redes sociales como las descritas previamente\.
Al analizar la literatura actual sobre el pronóstico de conflictos sociales, emergen dos tendencias claras: Primero, una transición metodológica desde modelos estadísticos univariados hacia arquitecturas híbridas de descomposición temporal\. Aunque el conflicto sigue estructuras estacionales predecibles, los picos abruptos de actividad dependen fundamentalmente de variables exógenas o del suavizado de picos estacionales\. Por lo tanto, los sistemas actuales se enfocan en aislar componentes deterministas mediante modelos estadísticos robustos, reservando el procesamiento del lenguaje natural \(NLP\) para modelar residuales e intensidades latentes\. Segundo, una asimetría geográfica: los estudios empíricos se concentran en contextos en idioma inglés o en eventos de visibilidad internacional, dejando una brecha en entornos de conflicto recurrente y baja visibilidad mediática, como es el caso de Bolivia\.
No existe en la literatura actual ningún sistema aplicado específicamente a los bloqueos de carreteras en Bolivia, ni una evaluación que cuantifique el valor marginal proporcionado por las representaciones semánticas de la prensa sobre modelos de descomposición temporal como Prophet\[[22](https://arxiv.org/html/2607.21785#bib.bib22)\], ni una que compare dicha arquitectura con benchmarks independientes de aprendizaje automático y series temporales\. La presente propuesta aborda ambas brechas: combina intencionadamente la interpretabilidad de la descomposición temporal con la precisión local de modelos encoder\-only y gradient boosting calibrado, y valida la contribución del componente semántico frente a cuatro líneas de base externas—regresión logística regularizada \(B1\), LightGBM \(B2\), SARIMA univariado \(B3\) y XGBoost con características autorregresivas \(B4\)—todas evaluadas bajo el mismo esquema walk\-forward, con hiperparámetros optimizados sobre una ventana de ajuste independiente del período de evaluación final para garantizar que la comparación esté libre de sesgos de selección de modelos\.
## Apéndice CDatos y Metodología
### C\.1Fuentes de datos
Para este estudio, se integraron dos fuentes de información independientes con diferentes horizontes temporales\. La primera fuente es un archivo histórico de un portal de noticias boliviano que funciona como un agregador de noticias que replica y centraliza el contenido producido por diversos medios digitales nacionales\. Este archivo contiene 916,110 titulares de noticias sin procesar \(titulares, enlaces, marcas de tiempo y etiquetas\), que abarcan desde 2008 hasta 2026\. Para el período de análisis \(2020–2026\), el corpus filtrado temáticamente comprende 386,884 artículos distribuidos a lo largo de 2,137 días, con un promedio de 181 noticias relevantes por día\. Los 517,426 artículos restantes corresponden a la cobertura previa a 2020, un período sin registros de eventos viales en la ABC, y fueron descartados de la ventana de evaluación\. La segunda fuente proviene de los registros oficiales de la Administradora Boliviana de Carreteras \(ABC\), los cuales documentan 37,903 eventos del estado de carreteras entre el 13 de agosto de 2020 y el 13 de junio de 2026\. Para nuestra investigación, restringimos el análisis al período compartido \(2020–2026\), filtrando los datos de la ABC para incluir exclusivamente interrupciones debidas a conflictos sociales en seis corredores estratégicos para el transporte nacional \(Rutas 1, 4, 5, 6, 7 y 25\)\. La agregación de la variable objetivo a nivel nacional responde a una restricción intrínseca de la fuente de datos textuales: más del 90 % de los titulares de prensa omiten la nomenclatura específica de la ruta vial \(p\. ej\., Ruta 4 o Ruta 1\), limitándose a reportar la intencionalidad del conflicto social\. Forzar una desagregación espacial a nivel de ruta introduciría un sesgo de datos faltantes y reduciría drásticamente el poder estadístico del conjunto de datos\. Por lo tanto, el marco híbrido se formula como un proxy del riesgo sistémico nacional\.
Figura 8:Resultado final del proceso de integración y modelado\.
### C\.2Preprocesamiento y filtrado temático
El corpus de noticias se depuró en dos fases\. En primer lugar, se eliminó la categoría “Mundo” debido a su falta de relevancia para el conflicto local\. En segundo lugar, aplicamos un filtro basado en clasificación temática zero\-shot \(detallada en la Sección 3\.3\) para excluir contenido no relacionado con el fenómeno, como deportes, entretenimiento, horóscopo y moda\. Tras este proceso, el corpus resultante se ajustó a 903,602 artículos\.
Para alinear temporalmente ambas fuentes, se adoptó un criterio de corte dinámico: el inicio de la serie temporal se fijó una semana antes de la fecha del primer bloqueo registrado en la base de datos de la ABC\. Este margen garantiza que el modelo cuente con el contexto mediático previo necesario sin incluir períodos de inactividad que no aportan una señal predictiva para el fenómeno estudiado\.
### C\.3Extracción de características textuales
Se aplicaron tres procesos de extracción de características a cada noticia filtrada utilizando modelos de lenguaje preentrenados:
Clasificación de relevancia vial \(zero\-shot\)\.Se utilizó un clasificador multilingüe zero\-shot \(mDeBERTa\-v3\-base\-mnli\-xnli\) para asignar a cada titular una puntuación de relevancia continua con respecto a cuatro niveles de intensidad de conflicto vial:
– Bloqueo físico confirmado \(peso de referencia 1\.0\)
– Anuncio de marcha o bloqueo \(0\.60\)
– Paro o demanda sindical \(0\.20\)
– Contenido no relacionado \(0\.0\)\.
Adicionalmente, se registró para cada noticia el nivel discreto con la mayor probabilidad \(Nivel\_Bloqueo\_ZS\)\.
Análisis de sentimiento\.Se aplicó un modelo de análisis de sentimiento en español \(RoBERTuito, a través de la libreríapysentimiento\) para obtener una puntuación de polaridad continua por noticia\.
Representación semántica vectorial\.Cada titular se transformó en un vector de 384 dimensiones utilizando el modelo de embeddings de oraciones multilingüeparaphrase\-multilingual\-MiniLM\-L12\-v2\. Se realizó una evaluación preliminar sobre la reducción de esta dimensionalidad a un espacio latente de baja dimensión \(d=10d=10\) mediante el Análisis de Componentes Principales \(PCA\)\. Sin embargo, las pruebas experimentales demostraron una degradación sistemática en la capacidad discriminativa del clasificador \(AUC\-ROC\), atribuida a la pérdida masiva de varianza explicada inherente a una compresión tan agresiva de embeddings semánticos densos\. En consecuencia, se decidió preservar las 384 dimensiones originales para maximizar la capacidad expresiva y salvaguardar los límites de decisión del modelo\.
### C\.4Agregación diaria ponderada
Las noticias individuales se agregaron a nivel diario utilizando un esquema de ponderación basado en la puntuación de relevancia vial descrita en 3\.3\. Para cada díadd, el vector semántico agregado se calculó como el promedio ponderado de los embeddings de todas las noticias publicadas en ese día, utilizando la puntuación de relevancia vial como peso cuando esta fuera positiva, y un peso residual diferenciado \(0\.05 para noticias clasificadas explícitamente como irrelevantes, 0\.30 para noticias sin clasificación zero\-shot disponible\) en caso contrario\. Esta ponderación amplifica la contribución de las noticias con contenido semánticamente relacionado con un conflicto vial activo en comparación con la cobertura mediática de fondo no relacionada\.
Adicionalmente, el volumen absoluto de noticias, sus medias móviles de 3 y 7 días, su variación diaria \(delta\) y su puntuación z normalizada se calcularon como variables diarias, junto con el promedio diario de la puntuación de relevancia vial \(score\_bloqueo\_diario\) y el nivel máximo de escalada observado en el día \(nivel\_bloqueo\_max\)\.
### C\.5Componente de descomposición temporal
El modelo Prophet\[[22](https://arxiv.org/html/2607.21785#bib.bib22)\]se empleó para capturar la estructura estacional del fenómeno, incorporando componentes de estacionalidad semanal y anual\. Para evitar la fuga de información temporal, se ajustó un único modelo Prophet en cada paso del esquema de validación walk\-forward \(Sección 3\.7\) sobre el historial disponible hasta el día de evaluación, generando simultáneamente los valores ajustados dentro de la muestra \(utilizados como variable predictora en el conjunto de entrenamiento\) y las proyecciones fuera de la muestra para los siete horizontes de pronóstico evaluados\.
### C\.6Arquitectura de ablación de siete niveles
Con el fin de aislar la contribución incremental de cada fuente de información, se diseñaron siete configuraciones experimentales, cada una entrenada utilizando un clasificador XGBoost calibrado \(escalado de Platt a través deCalibratedClassifierCV\) con los siguientes hiperparámetros uniformes: profundidad máxima de 3, tasa de aprendizaje de 0\.1, 50 estimadores, submuestreo de columnas por árbol de 0\.3 \(regularización implícita dada la alta dimensionalidad de los embeddings\), submuestreo de filas de 0\.8 y un peso dinámico de la clase positiva \(scale\_pos\_weight\) recalculado en cada ventana de entrenamiento como la razón entre observaciones negativas y positivas, para compensar el desequilibrio moderado de clases \(prevalencia histórica≈\\approx38–41 %\)\.
Las siete configuraciones fueron:
\-C1 \(Prophet Puro\): solo la proyección de descomposición temporal, recalibrada mediante regresión logística \(escalado de Platt\) sobre los valores ajustados dentro de la muestra\.
\-C2 \(Volumen\): solo las variables de volumen de prensa \(conteo diario, medias móviles, delta, puntuación z\)\.
\-C3 \(NLP Puro\): solo el vector semántico agregado de 384 dimensiones, sin los componentes temporal o de volumen\.
\-C4 \(Volumen \+ Zero\-Shot \+ NLP\): integración de volumen, puntuación de relevancia vial y semántica, sin el componente temporal\.
\-C5 \(Prophet \+ Zero\-Shot\): componente temporal combinado con volumen y puntuación de relevancia vial\.
\-C6 \(Prophet \+ NLP\): componente temporal combinado con volumen y semántica vectorial completa\.
\-C7 \(Híbrido Total\): integración de las cuatro fuentes de información \(temporal, volumen, puntuación de relevancia vial, semántica\)\.
Para determinar si la ganancia observada en las configuraciones C5–C7 es atribuible a la arquitectura de información propuesta o al algoritmo de aprendizaje empleado, se evaluaron adicionalmente cuatro benchmarks externos bajo el mismo esquema walk\-forward y los mismos horizontes:
– B1 \(Regresión Logística Regularizada\) C=0\.01\.
– B2 \(LightGBM\) 100 estimadores, profundidad 3, tasa de aprendizaje 0\.05
– B3 \(SARIMA Univariado\) de orden \(1,1,1\)×\\times\(1,1,1,7\), reajustado en cada paso del walk\-forward sobre la seriehubo\_bloqueo
– B4 \(XGBoost\) con las mismas características que C7 más rezagos de la variable objetivo de 1, 2, 3 y 7 días\.
Los hiperparámetros de B1, B2 y B4 se seleccionaron mediante búsqueda en rejilla sobre una ventana de ajuste independiente \(del 15 de agosto de 2021 al 31 de diciembre de 2023\), excluyendo el período de evaluación final \(del 1 de enero de 2024 al 11 de junio de 2026\) para evitar el sesgo de selección de modelos\. Los benchmarks reciben las mismas características que C7, garantizando que cualquier diferencia observada refleje la capacidad del algoritmo y no la disponibilidad de información\.
### C\.7Esquema de validación: walk\-forward expandente
La evaluación se llevó a cabo utilizando un esquema de validación walk\-forward de ventana expansiva, considerado el estándar metodológico para prevenir la fuga de información en problemas de pronóstico de series temporales\[[23](https://arxiv.org/html/2607.21785#bib.bib23)\]\. Para cada díattdel período de evaluación \(del 15 de agosto de 2021 al 11 de junio de 2026; 1,762 días\), las siete configuraciones se entrenaron utilizando exclusivamente información disponible hasta el díat−1t\-1, y se generaron predicciones para los siete horizontes det\+1t\+1at\+7t\+7\. La variable objetivo de pronóstico \(YY\) en cada horizontehhse construyó desplazando la variable binaria de ocurrencia de bloqueos, garantizando que la variable predictorainercia\_prophetutilizada en el entrenamiento correspondiera, para cada observación histórica, a la proyección de Prophet generada para el día de impacto correspondiente a ese horizonte, replicando exactamente la estructura de información disponible en el momento de la inferencia real\.
### C\.8Métricas de evaluación
Se reportan cuatro familias de métricas\. Discriminación: área bajo la curva ROC \(AUC\-ROC\)\. Calibración: Brier Score y Brier Skill Score \(BSS\) con respecto a la climatología histórica del problema, definida comop\(1−p\)p\(1\-p\)dondeppes la prevalencia global de la clase positiva\. Clasificación binaria: precisión, exhaustividad \(recall\), F1\-score y log loss, calculados sobre el umbral de decisión que maximiza el F1\-score dentro del conjunto fuera de muestra para cada horizonte\. Significancia estadística: prueba de Diebold–Mariano \(Diebold & Mariano, 1995\) con corrección de varianza de Newey–West para horizontes múltiples, aplicada a siete comparaciones pareadas de interés científico, junto con el tamaño del efecto \(ddde Cohen\) sobre el diferencial del error cuadrático entre configuraciones\. Adicionalmente, este trabajo incluye curvas de calibración \(diagramas de confiabilidad\) para las configuraciones establecidas y los benchmarks en horizontes seleccionados \(H\+1, H\+4 y H\+7\), brindando la oportunidad de evaluar la coherencia entre las probabilidades emitidas y las frecuencias correspondientes\. La interpretabilidad del modelo C7 también se examina utilizando valores SHAP \(SHapley Additive exPlanations\), calculados sobre el clasificador XGBoost base antes de la calibración de Platt, con las 384 dimensiones de los embeddings agregadas como un único grupo para facilitar la lectura\.
## Apéndice DResultados y Discusión
### D\.1Evaluación de rendimiento predictivo
La evaluación de las siete configuraciones experimentales bajo el esquema de validación walk\-forward evidencia una división entre dos grupos de modelos\. Las configuraciones que incorporan el componente de descomposición temporal \(C1, C5, C6, C7\) superan a aquellas que no lo hacen \(C2, C3, C4\) en AUC\-ROC y Brier Score en casi todos los horizontes evaluados\. Dentro del primer grupo, la incorporación de señales semánticas de noticias sobre la línea de base estacional \(C6: Prophet\+NLP\) produce una mejora consistente con respecto a Prophet puro \(C1\) a lo largo de los siete horizontes, tanto en capacidad discriminativa como en calibración probabilística\.
Figura 9:Area bajo la curva \(AUC\) por horizonte de pronósticoLa comparación entre C6 y C7 \(Híbrido Total\) revela que no existe una diferencia estadísticamente significativa en la mayoría de los horizontes\. Esta equivalencia ocurre porque la puntuación de relevancia zero\-shot ya está incorporada implícitamente en C6 como el mecanismo de ponderación durante la agregación diaria de embeddings \(Sección 3\.4\)\. En consecuencia, añadir la puntuación zero\-shot como una característica tabular explícita en C7 proporciona información redundante, confirmando a C6 como la arquitectura más parsimoniosa\.
La evaluación de los cuatro benchmarks externos sobre el mismo período de walk\-forward revela un patrón distinto que depende tanto del horizonte como de la métrica considerada\. En términos de discriminación \(AUC\-ROC\), el benchmark más competitivo en H\+1 resulta ser B3 \(SARIMA univariado\), con AUC=0\.704, un valor que supera a C6 \(0\.677\) y C7 \(0\.671\) en ese horizonte específico\. Este resultado refleja el fuerte componente autorregresivo a corto plazo en la serie de bloqueos de carreteras: cuando un corredor se interrumpe en el díatt, la probabilidad de interrupción ent\+1t\+1es sustancialmente mayor que la tasa base, una señal que SARIMA captura directamente sin necesidad de información textual\. B2 \(LightGBM entrenado sobre el mismo conjunto de características que C7\) alcanza un AUC=0\.680 en H\+1, el cual también es superior o comparable a C6, y mantiene su competitividad en H\+2 \(0\.656\) y H\+3 \(0\.640\)\.
Sin embargo, esta ventaja de los benchmarks univariados y alternativos se revierte sistemáticamente a medida que se extiende el horizonte\. B3 cae de AUC=0\.704 en H\+1 a 0\.606 en H\+7, mientras que C6 se ubica en 0\.578, y en Brier Score, C6 supera de manera consistente a B3 en todos los horizontes\. Aún más relevante para la aplicación operacional, B3 presenta los valores de log loss más altos del estudio \(véase la Tabla[14](https://arxiv.org/html/2607.21785#Ax1.T14)\), mostrando una deficiente calibración probabilística: el modelo emite probabilidades extremas que se desvían de las frecuencias reales, limitando directamente su utilidad como sistema de alerta en producción donde la probabilidad emitida se utiliza para escalar la respuesta logística\. B4 \(XGBoost con rezagos de la variable objetivo autorregresivos en lugar de embeddings semánticos\) muestra el rendimiento más débil entre el grupo de benchmarks, con AUC entre 0\.462 y 0\.474 en todos los horizontes—cercano al nivel del azar—, lo que confirma que la inercia temporal de la variable objetivo por sí sola no captura la señal que los embeddings de prensa proporcionan en horizontes medios y largos\. B1 \(Regresión Logística regularizada\) ocupa una posición intermedia, con AUC entre 0\.589 \(H\+7\) y 0\.644 \(H\+4\), y un log loss comparable al de C5, lo que sugiere que una función lineal sobre el espacio de características captura parte del patrón de conflicto pero carece de la capacidad para modelar las interacciones no lineales explotadas por C6 y C7\.
Figura 10:Brier Score por horizonte de pronóstico\.Figura 11:Brier Skill Score \(BSS\) por horizonte de pronóstico\.Rendimiento del modelo híbrido: Las configuraciones C6 y C7 presentan los valores más bajos de Brier Score \(mejor rendimiento\) a lo largo de la mayoría de los horizontes evaluados \(H\+1 a H\+7\), lo que indica una mayor precisión en la estimación de probabilidades en comparación con la realidad observada\. En particular, C6 se destaca con un BSS positivo que es consistentemente superior al de C1 \(Prophet puro\), validando que la incorporación de representaciones semánticas de la prensa añade valor predictivo al corregir las estimaciones probabilísticas del componente estacional\.
Rendimiento del modelo híbrido: Las configuraciones C6 y C7 presentan los valores más bajos de Brier Score \(mejor rendimiento\) a lo largo de la mayoría de los horizontes evaluados \(H\+1 a H\+7\), lo que indica una mayor precisión en la estimación de probabilidades en comparación con la realidad observada\. En particular, C6 se destaca con un BSS positivo que es consistentemente superior al de C1 \(Prophet puro\), validando que la incorporación de representaciones semánticas de la prensa añade valor predictivo al corregir las estimaciones probabilísticas del componente estacional\.
Comparación con Benchmarks: Al contrastar con los modelos externos, observamos una ventaja competitiva para C6\. Aunque B3 \(SARIMA\) muestra valores bajos de Brier Score en el horizonte inmediato \(H\+1: 0\.223\), su rendimiento se degrada rápidamente a medida que se expande el horizonte\. Esta debilidad se refleja claramente en el BSS \(Tabla[12](https://arxiv.org/html/2607.21785#Ax1.T12)\), donde C6 mantiene una ventaja sostenida sobre B3, que pasa de valores positivos en H\+1 a un deterioro del rendimiento \(valores negativos\) a partir de H\+3\. Esto confirma que el modelo híbrido propuesto ofrece una calibración probabilística más robusta y estable para la toma de decisiones logísticas a mediano plazo\.
Capacidad discriminativa y calibración: La consistencia de C6 y C7 al mantener un BSS positivo en horizontes extendidos, en comparación con la volatilidad de los modelos puramente autorregresivos \(como B3\) o los modelos sin componente temporal \(C3 y C4\), subraya que la combinación de estacionalidad y semántica no solo mejora la discriminación, sino que también optimiza la confiabilidad de las alertas probabilísticas generadas por el sistema\.
### D\.2Significancia estadística y robustez test de Diebold Mariano \(todos los pares relevantes\)
La prueba de Diebold–Mariano confirma que la incorporación de la representación semántica vectorial \(C6\) reduce el error de pronóstico en comparación con el modelo de descomposición temporal puro \(C1\), con valores p inferiores a 0\.002 a lo largo de los siete horizontes evaluados \(Tabla[1](https://arxiv.org/html/2607.21785#S4.T1)\)\. El tamaño del efecto \(ddde Cohen, entre−0,099\-0\{,\}099y−0,152\-0\{,\}152\) corresponde a una magnitud pequeña de acuerdo con los umbrales convencionales, pero es consistente y estadísticamente robusto\.
Cuadro 22:Par C6 vs C1 — ¿NLP agrega sobre Prophet?Cuadro 23:C6 vs C3 — ¿Prophet\+NLP supera NLP puro?El contraste entre C6 y C3 \(NLP puro, sin componente temporal\) es informativo, revelando el mayor tamaño del efecto en todo el estudio \(ddde Cohen entre \-0\.147 y \-0\.201,p<0,0001p<0\{,\}0001a lo largo de todos los horizontes\)\. Esto demuestra que la representación semántica de la prensa requiere el anclaje proporcionado por el componente estacional para constituir una señal predictiva útil; por sí sola, esta representación no discrimina de manera confiable entre días con y sin bloqueos, como lo confirma su AUC al estar cercano o por debajo del nivel del azar \(0\.44–0\.51\) en la mayoría de los horizontes\.
Cuadro 24:C7 vs C6 — ¿ZS agrega sobre Prophet\+NLP? \[RELEVANCIA ZS\]Cuadro 25:C7 vs B1 — ¿Híbrido supera a Logistic Regression? \[BENCHMARK LINEAL\]Cuadro 26:C7 vs B2 — ¿Híbrido supera a LightGBM equivalente? \[BENCHMARK GBM ALT\.\]Cuadro 27:C7 vs B3 — ¿Híbrido supera a SARIMA univariado? \[BENCHMARK ARIMA\]Cuadro 28:C7 vs B4 — ¿NLP agrega sobre Lag Features\+XGBoost? \[BENCHMARK AUTOREGRESIVO\]Las pruebas de Diebold–Mariano frente a los cuatro benchmarks externos \(Tablas[4](https://arxiv.org/html/2607.21785#S4.T4)–[7](https://arxiv.org/html/2607.21785#S4.T7)\) abordan directamente si la superioridad de C7 sobre C1 es atribuible a la arquitectura de información propuesta o al algoritmo de aprendizaje empleado\. Frente a B2 \(LightGBM entrenado con el mismo conjunto de características que C7\), la prueba DM produce valores significativos a lo largo de los siete horizontes \(p<0,05p<0\{,\}05en todos los casos,p<0,01p<0\{,\}01en la mayoría\), descartando que la ganancia observada de C7 sobre C1 pueda explicarse por una ventaja inherente del algoritmo XGBoost sobre otros métodos de gradient boosting: cuando el conjunto de información es idéntico, XGBoost calibrado con descomposición temporal supera consistentemente a LightGBM\. La comparación frente a B4 \(XGBoost con rezagos autorregresivos de la variable objetivo en lugar de embeddings semánticos\) también es significativa de H\+1 a H\+6, con unddde Cohen entre−0,08\-0\{,\}08y−0,15\-0\{,\}15, lo que confirma que la señal semántica extraída de los embeddings de prensa proporciona información no capturada por la mera inercia temporal de la variable objetivo expresada como rezagos directos\.
Frente a B1 \(Regresión Logística\) y B3 \(SARIMA\), el patrón es más matizado\. C7 supera significativamente a B1 en H\+1 y H\+2 \(p<0,05p<0\{,\}05\), pero la diferencia no alcanza la significancia estadística de H\+3 a H\+7, lo cual es consistente con la competitividad de B1 en F1\-score en horizontes medios observada en los experimentos\. Frente a B3 \(SARIMA\), C7 muestra una ventaja significativa de H\+3 a H\+7 pero no en H\+1, donde el componente autorregresivo inmediato favorece al modelo univariado —un hallazgo consistente con el mayor AUC de B3 en ese horizonte específico, ya discutido en la Sección 4\.1\. En conjunto, estos resultados sugieren que la contribución del componente semántico es más robusta frente a alternativas de gradient boosting que frente a modelos puramente temporales en horizontes cortos, y que la ventaja del sistema híbrido propuesto se consolida a partir de H\+3, donde la estructura estacional de Prophet combinada con la señal semántica de la prensa captura información que los benchmarks univariados no pueden representar\.
Cuadro 29:Racha más larga sin bloqueos: 41 días\. Período: 15 de noviembre a 25 de diciembre de 2024 \(criterio objetivo: máxima racha consecutiva libre en el histórico\)Como prueba de cordura \(\*sanity check\*\) para verificar la consistencia discriminativa lógica, se evaluó el rendimiento del sistema utilizando el margen de separación de probabilidad de clase, definido comoΔP=P\(Bloqueo\)−P\(Libre\)\\Delta P=P\(\\text\{Bloqueo\}\)\-P\(\\text\{Libre\}\)\. Un modelo de pronóstico probabilístico válido debe satisfacerΔP\>0\\Delta P\>0, garantizando que asigne sistemáticamente probabilidades de riesgo más altas a eventos reales de bloqueo que a días libres\.
El comportamiento del sistema durante períodos prolongados de calma social se evaluó sobre la racha más larga de días consecutivos sin bloqueos registrada en los datos históricos \(41 días, abarcando noviembre y diciembre de 2024\)\. Dentro de esta ventana de prueba específica, las configuraciones ancladas temporalmente \(C1C1,C5C5,C6C6,C7C7\) mantienen consistentemente una separación positiva en todos los horizontes evaluados \(H\+1H\+1,H\+3H\+3,H\+7H\+7\)\. Esto confirma que su capacidad discriminativa no depende exclusivamente de la prevalencia histórica de la clase positiva\. En particular, la arquitectura propuesta \(C6C6\) mantiene márgenes positivos estables \(\+0,088\+0\{,\}088enH\+1H\+1,\+0,050\+0\{,\}050enH\+3H\+3y\+0,029\+0\{,\}029enH\+7H\+7\), lo que demuestra que su señal proviene de dinámicas genuinas previas al conflicto en lugar de falsas alarmas durante períodos de calma\.
En contraste, las configuraciones ingenuas de solo NLP e híbridas integradas de manera inadecuada \(C2–C4C2\\text\{\-\-\}C4\), junto con la línea de base persistente \(B4B4\), fallan esta prueba de cordura\. Las configuracionesC3C3yC4C4exhiben una separación negativa enH\+3H\+3yH\+7H\+7\(alcanzando−0,014\-0\{,\}014paraC3C3enH\+7H\+7\), asignando erróneamente en promedio una mayor probabilidad a días efectivamente libres que a días con bloqueos dentro de esta ventana, lo que constituye una prueba adicional de su limitada capacidad discriminativa en ausencia del componente temporal\. Además, aunque los benchmarks basados en árboles \(B2B2,B3B3\) muestran una mayor separación bruta enH\+1H\+1debido a estimaciones extremas de probabilidad cercanas a0y11, esta sobreconfianza conduce a una severa degradación de la calibración a lo largo de horizontes extendidos\. La configuraciónC6C6logra el equilibrio óptimo entre una separación de clases robusta y una calibración probabilística a largo plazo\.
Figura 12:Capacidad de separación de las distintas configuraciones entre días con bloqueo y días libres\.
### D\.3Métricas de clasificación y calibración
El análisis de la matriz de confusión y de las métricas de clasificación derivadas \(Sección 6D\) confirma el mismo patrón observado en las métricas probabilísticas: las configuraciones C3, C4 y, en menor medida, C2 tienden a colapsar hacia una predicción casi uniforme de la clase positiva a lo largo de múltiples horizontes \(exhaustividad cercana a 1\.0 con especificidad cercana a 0\), un comportamiento consistente con la ausencia de una señal discriminativa real más que con un rendimiento efectivo del clasificador\. En contraste, las configuraciones C5, C6 y C7 exhiben matrices de confusión con una representación sustancial en las cuatro categorías de clasificación, alcanzando los valores más altos de F1\-score en el estudio \(C6: 0\.583–0\.617\) bajo el umbral de decisión óptimo determinado en el conjunto fuera de muestra para cada horizonte\.
### D\.4Radar de riesgo operativo: caso de aplicación
Como ejercicio de validación operacional, el sistema se ejecutó en la semana del 12 al 18 de junio de 2026, generando pronósticos fuera de muestra para los siete horizontes evaluados\. La configuración C6 proyectó probabilidades de bloqueo de carreteras sustancialmente superiores a la tasa base de los últimos 365 días \(30\.7 %\) a lo largo de la totalidad del horizonte analizado, alcanzando “Riesgo Alto” según el umbral del percentil 80 de la distribución histórica de predicciones en todos los días excepto H\+7\. Cabe destacar la divergencia entre la proyección de C6 y la del componente Prophet calibrado de forma aislada \(C1\), el cual en los horizontes H\+2 y H\+3 proyectó probabilidades por debajo de la tasa base \(18\.97 % y 14\.54 %, respectivamente\) en contraste con las probabilidades superiores al 70 % emitidas por C6\. Esta divergencia ilustra el mecanismo propuesto en este trabajo: la incorporación de señales semánticas de prensa permite al sistema detectar escaladas en la tensión social no capturadas por la estructura estacional pura, cuyo comportamiento es validado rigurosamente mediante el monitoreo de la materialización real de estos pronósticos en los días posteriores\.
Cuadro 30:Riesgo de bloqueo semanal
R\. ALTO = Riesgo alto; R\. MOD = Riesgo moderado\.
![[Uncaptioned image]](https://arxiv.org/html/2607.21785v1/x3.png)Figura 13:Riesgo operativo semanal en rutas críticas según las configuraciones C6 y C7\.Aunque B3 \(SARIMA\) y B2 \(LightGBM\) exhiben un AUC competitivo o superior en comparación con C6 en H\+1, su selección como sistema operacional se desaconseja por dos razones: B3 presenta la calibración probabilística más deficiente del estudio \(log loss 0\.80–0\.86\), lo que limita la interpretabilidad de sus probabilidades como medidas de riesgo accionables; y ambos modelos muestran una degradación consistente a partir del horizonte H\+3 en adelante, mientras que C6 mantiene un Brier Score más bajo a lo largo de los siete horizontes\. El radar operacional presentado en la Figura 4 utiliza C6 como la configuración principal precisamente debido a esta combinación de calibración probabilística y consistencia multihorizonte\.
Un aspecto clave para la implementación operacional del sistema es la gestión del umbral de decisión\. Las curvas de Precisión\-Exhaustividad \(Figura[14](https://arxiv.org/html/2607.21785#A4.F14)\) ilustran la relación de compromiso \(\*trade\-off\*\) disponible en los horizontes H\+1, H\+4 y H\+7\. En H\+1, C6 \(Precisión Promedio=0\.599\) supera consistentemente a C1 \(AP=0\.517\) a lo largo de todo el espacio de Precisión\-Exhaustividad: bajo el umbral optimizado para F1 \(0\.39\), C6 detecta el 78 % de los bloqueos reales con una precisión del 51 %, mientras que elevar el umbral a 0\.60 produce una precisión del 66 % a costa de reducir la exhaustividad al 20 %—operacionalmente útil para decisiones de alto costo fijo como el desvío de carga pesada\. En H\+4, la ventaja de C6 \(AP=0\.525\) sobre C1 \(AP=0\.501\) se mantiene, aunque reducida, convergiendo ambas curvas en el rango medio de exhaustividad\. En H\+7, C1 \(AP=0\.495\) recupera una ligera ventaja sobre C6 \(AP=0\.474\) en discriminación binaria, un resultado consistente con la competitividad de Prophet en AUC en ese horizonte—aunque C6 conserva su superioridad en Brier Score, lo que confirma que la ventaja del componente semántico se desplaza de la discriminación hacia la calibración probabilística a medida que el horizonte se extiende\. La calibración de C6 es precisamente lo que permite este ajuste de umbral: un modelo mal calibrado no puede ofrecer tal superficie de decisión, independientemente de su AUC\.
Figura 14:Precision\-Recall curves C6 vs C1 \(H\+1, H\+4, H\+7\)\.
## Apéndice EDiscusión y limitaciones
Este trabajo demuestra que la integración del análisis semántico de noticias proporciona una mejora estadísticamente significativa con respecto a los modelos configurados puramente con componentes temporales \(C6 frente a C1\)\. Los conflictos por bloqueos de carreteras en Bolivia exhiben una fuerte estructura estacional capturada por los modelos de series temporales de línea de base; sin embargo, la adición de embeddings vectoriales densos en C6 suaviza los picos estacionales falsos al tiempo que proporciona un equilibrio estructural general a los pronósticos\. El rendimiento superior de C6 en relación con las configuraciones internas restantes \(C1–C5\) y las líneas de base externas \(B1–B4\) confirma que su valor predictivo proviene de la interacción complementaria entre la inercia temporal y las señales semánticas\. Cabe destacar que la comparación entre la configuración C6 y la C7 \(que incorpora explícitamente puntuaciones de clasificación zero\-shot\) revela que añadir métricas zero\-shot explícitas introduce información redundante\. Los embeddings vectoriales densos ya capturan suficiente relevancia semántica sin requerir una categorización explícita adicional, lo que valida a C6 como la arquitectura híbrida más parsimoniosa y efectiva\.
A pesar de estos hallazgos empíricos positivos, se deben reconocer varias limitaciones metodológicas, temporales y espaciales:
Resolución espacial y granularidad del corredor: Si bien el modelo ofrece estimaciones de riesgo robustas para la red vial principal de Bolivia —cubriendo específicamente corredores de transporte críticos como las Rutas 1, 4, 5, 6, 7 y 25—, actualmente trata todas las rutas críticas como un objetivo único agregado\. Este enfoque a nivel macro introduce un sesgo de dilución espacial, ya que las dinámicas de conflicto en regiones como el Chapare difieren fundamentalmente de aquellas en Santa Cruz, Potosí o La Paz\. Desagregar estas rutas críticas en segmentos geográficos específicos será esencial en futuras iteraciones para entregar alertas más granulares y específicas por ubicación\.
Sesgo del agregador de medios: El conjunto de datos textuales se basa exclusivamente en el portal agregador de noticias boliviano\. Por consiguiente, el sistema opera bajo la parcialidad potencial y el encuadre editorial inherentes a este medio específico\. El modelo captura eficazmente el conflicto social según es filtrado e informado por este portal, en lugar de representar una verdad de terreno absoluta de la agitación social\. Se requerirá un análisis comparativo frente a fuentes de medios múltiples para cuantificar y mitigar el sesgo de un solo agregador\.
Latencia de reporte y agilidad en tiempo real: Aunque el esquema de validación walk\-forward de ventana expansiva previene estrictamente la fuga de datos \(Xt→Yt\+hX\_\{t\}\\to Y\_\{t\+h\}\), la latencia inherente de los datos periodísticos puede restringir la agilidad de respuesta inmediata\. Los artículos de noticias publicados en el díattpueden describir bloqueos de emergencia repentinos y no anunciados que se materializaron temprano esa misma mañana\. Si bien el sistema se destaca en la predicción de horizontes de escalada de conflicto de múltiples días, los retrasos en los reportes intradía limitan su utilidad para el desvío de emergencia en tiempo real durante eventos espontáneos\.
Adaptación de dominio, modismos locales y cambios de régimen político: El procesamiento de embeddings se apoya en modelos de lenguaje preentrenados generales que pueden no capturar completamente expresiones idiomáticas locales, coloquialismos o jerga específica de la prensa boliviana\. Además, el discurso mediático sufre cambios semánticos durante las transiciones políticas, como el establecimiento del nuevo gobierno a fines de 2025\. La implementación de un ajuste fino periódico y una adaptación continua del dominio representa una vía crítica para mantener una señal semántica confiable a lo largo de panoramas políticos en evolución\.
Consideraciones sociopolíticas y éticas: Los bloqueos de carreteras en Bolivia son fenómenos humanos complejos arraigados en dinámicas de poder, identidad colectiva y demandas estructurales, a menudo precedidos por asambleas locales no registradas o negociaciones sindicales\. Los modelos de aprendizaje automático capturan la escalada discursiva en los medios, pero no pueden comprender las causas sociopolíticas subyacentes\. Fundamentalmente, este sistema predictivo está diseñado estrictamente como una herramienta de apoyo a la decisión logística para la resiliencia de la cadena de suministro y la seguridad del transporte; no debe utilizarse para criminalizar la protesta social ni para sustituir el diálogo político constructivo\.
## Apéndice FConclusiones
Esta investigación validó la viabilidad y superioridad de un marco híbrido para el pronóstico y detección temprana de bloqueos de carreteras en rutas de transporte críticas en Bolivia\. La robustez estadística de los modelos temporales se integró con el contexto necesario derivado de los titulares de noticias\. A través de un esquema \*walk\-forward\* que abarca aproximadamente 1,700 días, se demostró que la incorporación de la representación y análisis semántico vectorial \(C6\) supera consistentemente a los modelos estadísticos univariados o a los enfoques de aprendizaje automático puros\.
Las contribuciones fundamentales de este trabajo son dos:
Se verificó que el valor predictivo no reside únicamente en una configuración estacional; más bien, la contribución semántica e híbrida se sostiene a lo largo de horizontes a mediano plazo, a diferencia de los modelos autorregresivos\.
Las representaciones vectoriales capturan de manera eficiente la intensidad y los matices del conflicto sin la necesidad de una categorización explícita\. Esto optimiza la eficiencia operacional del sistema al reducir el procesamiento adicional\.
## Referencias
- \[1\]M\. Gaja, “Bolivia actual: la acción del movimiento indígena”, Itiner\. Rev\. Estud\. Lingüisticos Lit\. Históricos Antropológicos, n\.o 6, pp\. 297–312\.
- \[2\]R\. Tellería, “Bloqueos: ¿derecho, instrumento de lucha o instrumento político?”, Los Tiempos, 26 de enero de 2026\.
- \[3\]M\. C\. Zeballos Puccherelli, “Grupos de presión\. Caracterización analítica de la acción colectiva de sectores sociales en la conflictividad boliviana”, Crítica Resist\. Rev\. Confl\. Soc\. Latinoam\., n\.o 19, pp\. 166–197, dic\. 2024\.
- \[4\]M\. S\. Trigo, “Bloqueos, enfrentamientos y muertes: cinco puntos para entender lo que está pasando en Bolivia”, Infobae, 15 de junio de 2025\.
- \[5\]F\. Molina, “Evistas versus arcistas\. Guerra abierta en el MAS boliviano”, Nueva Sociedad, n\.o 307, Friedrich Ebert Stiftung, Buenos Aires, Argentina, pp\. 4–13, septiembre de 2023\.
- \[6\]J\. P\. Marca y M\. M\. Noriega Villagómez, “Bolivia”, Décimo Inf\. Acceso Tierra Territ\. En Sudamérica, n\.o 10, pp\. 89–116, dic\. 2025\.
- \[7\]Economy, “Conflictos y bloqueos dejaron un impacto económico equivalente al 4 % del PIB”, junio de 2026\. \[En línea\]\. Disponible en:[https://www\.economy\.com\.bo/articulo/economia/conflictos\-bloqueos\-dejaron\-impacto\-economico\-equivalente\-4\-pib/20260601172554022699\.html](https://www.economy.com.bo/articulo/economia/conflictos-bloqueos-dejaron-impacto-economico-equivalente-4-pib/20260601172554022699.html)
- \[8\]El Deber, “Bloqueos golpean al turismo: hoteles registran hasta 90 % de cancelaciones y pérdidas superan los $us 200 millones”, 12 de junio de 2026\. \[En línea\]\. Disponible en:[https://eldeber\.com\.bo/economia/bloqueos\-golpean\-turismo\-hoteles\-registran\-90\-cancelaciones\-perdidas\-superan\-us\-200\-millones\_1781318488](https://eldeber.com.bo/economia/bloqueos-golpean-turismo-hoteles-registran-90-cancelaciones-perdidas-superan-us-200-millones_1781318488)
- \[9\]R\. F\. Molina Rodriguez, “Geografía del conflicto: Análisis de bloqueos en la red vial fundamental a partir de datos abiertos”, Rev\. Boliv\. Investig\. Geográficas, vol\. 1, n\.o 1, jun\. 2025, \[En línea\]\. Disponible en:[https://ojs\.umsa\.bo/index\.php/revigeo](https://ojs.umsa.bo/index.php/revigeo)
- \[10\]M\. V\. Fernández Ovando, J\. Chocata Gomez, P\. E\. Apaza Marce, y O\. C\. Siles Garcia, “Propuesta y análisis de implementación de sanciones penales para los responsables de bloqueos de carreteras en Bolivia”, Cienc\. Lat\. Int\., vol\. 8, n\.o 5, pp\. 2–23, oct\. 2024\.
- \[11\]GDELPROJECT, “GDELPROJECT”\. \[En línea\]\. Disponible en:[https://www\.gdeltproject\.org/solutions\.html](https://www.gdeltproject.org/solutions.html)
- \[12\]D\. Hong, Z\. Fu, X\. Zhang, y Y\. Pan, “Research on the Development and Application of the GDELT Event Database”, Data, vol\. 10, n\.o 10, p\. 158, oct\. 2025, doi: 10\.3390/data10100158\.
- \[13\]D\. Gerner J\., R\. Jabr, y P\. A\. Schrodt, “Conflict and Mediation Event Observations \(CAMEO\): A New Event Data Framework for the Analysis of Foreign Policy Interactions”\. \[En línea\]\. Disponible en:[https://www\.researchgate\.net/publication/2840364\_Conflict\_and\_Mediation\_Event\_Observations\_CAMEO\_A\_New\_Event\_Data\_Framework\_for\_the\_Analysis\_of\_Foreign\_Policy\_Interactions\#references](https://www.researchgate.net/publication/2840364_Conflict_and_Mediation_Event_Observations_CAMEO_A_New_Event_Data_Framework_for_the_Analysis_of_Foreign_Policy_Interactions#references)
- \[14\]N\. Ramakrishnan et al\., “Beating the news” with EMBERS: Forecasting Civil Unrest using Open Source Indicators”, 2014, arXiv\. doi: 10\.48550/ARXIV\.1402\.7035\.
- \[15\]J\. Cadena, G\. Korkmaz, C\. J\. Kuhlman, A\. Marathe, N\. Ramakrishnan, y A\. Vullikanti, “Forecasting Social Unrest Using Activity Cascades”, PLOS ONE, vol\. 10, n\.o 6, p\. e0128879, jun\. 2015, doi: 10\.1371/journal\.pone\.0128879\.
- \[16\]I\. Weber, V\. R\. K\. Garimella, y A\. Batayneh, “Secular vs\. Islamist polarization in Egypt on Twitter”, en Proceedings of the 2013 IEEE/ACM International Conference on Advances in Social Networks Analysis and Mining, Niagara Ontario Canada: ACM, ago\. 2013, pp\. 290–297\. doi: 10\.1145/2492517\.2492557\.
- \[17\]S\. Hlatshwayo y C\. Redl, “Forecasting Social Unrest: A Machine Learning Approach”, IMF Work\. Pap\., vol\. 2021, n\.o 263, p\. 1, nov\. 2021, doi: 10\.5089/9781557758873\.001\.
- \[18\]S\. Yao et al\., “ReAct: Synergizing Reasoning and Acting in Language Models”, 10 de marzo de 2023, arXiv: arXiv:2210\.03629\. doi: 10\.48550/arXiv\.2210\.03629\.
- \[19\]Q\. Huang, Z\. Zhou, K\. Yang, y Y\. Wang, “Exploiting Language Power for Time Series Forecasting with Exogenous Variables”, en Proceedings of the ACM on Web Conference 2025, Sydney NSW Australia: ACM, abr\. 2025, pp\. 4043–4052\. doi: 10\.1145/3696410\.3714793\.
- \[20\]G\. P\. Zhang, “Time series forecasting using a hybrid ARIMA and neural network model”, Neurocomputing, vol\. 50, pp\. 159–175, ene\. 2003, doi:[https://doi\.org/10\.1016/S0925\-2312\(01\)00702\-0](https://doi.org/10.1016/S0925-2312(01)00702-0)\.
- \[21\]G\. Elliott, Ed\., “Handbook of economic forecasting\. 1”, 1\. ed\., en Handbooks in economics, no\. 24,1\., Amsterdam: Elsevier, 2006\.
- \[22\]S\. J\. Taylor y B\. Letham, “Forecasting at scale”, 27 de septiembre de 2017, PeerJ Preprints\. doi: 10\.7287/peerj\.preprints\.3190v2\.
- \[23\]R\. J\. Hyndman y G\. Athanasopoulos, “Forecasting: Principles and Practice”\. \[En línea\]\. Disponible en:[https://otexts\.com/fpp3/](https://otexts.com/fpp3/)
## Material Suplementario
Cuadro 31:Resumen F1\-score \(general\)Cuadro 32:Resumen Log Loss \(general\)### Matriz De Confusión Y Métricas De Clasificación — C1\-C7
Umbral óptimo: maximiza F1 en el conjunto OOS de horizonte H\+1
Cuadro 33:Tabla H\+1Cuadro 34:Tabla H\+2Cuadro 35:Tabla H\+3Cuadro 36:Tabla H\+4Cuadro 37:Tabla H\+5Cuadro 38:Tabla H\+6Cuadro 39:Tabla H\+7Similar Articles
From Long News to Accurate Forecast: Importance-Aware Fusion and PRM-Guided Reflection for Time Series Forecasting
This paper introduces a framework for time series forecasting that uses importance-aware news compression and process reward model-guided retrieval to incorporate long news articles within fixed context limits, improving prediction accuracy across finance, energy, traffic, and Bitcoin benchmarks.
Do Time Series Foundation Model Benchmarks Hide Regime-Dependent Failures? Evidence from Traffic Speed Forecasting
This paper introduces regime-stratified evaluation for time series foundation models, revealing that aggregate metrics hide severe failures during traffic regime transitions, and proposes bimodal mixture augmentation to improve coverage while preserving overall accuracy.
Metric-Aware Hybrid Forecasting for the CTF4Science Lorenz Challenge
The paper describes a metric-aware hybrid forecasting system for the CTF4Science Lorenz challenge, combining neural denoisers, ODE fitting, and histogram-tail substitution to optimize different metrics across nine task pairs, achieving a public leaderboard score of 83.85529.
Nested Spatio-Temporal Time Series Forecasting
This paper proposes a nested spatiotemporal forecasting framework that uses spectral clustering to construct semantically coherent macro-level regions, which provide top-down guidance for fine-grained micro-level predictions. Experiments on high-dimensional datasets show consistent improvements over state-of-the-art baselines.
An Integrated Forecasting Prototype for Emergency Department Boarding Time to Support Proactive Operational Decision Making
This paper presents a multi-horizon time series forecasting framework for predicting emergency department boarding time using DLinear and NLinear models, and develops an MLOps web application prototype to support proactive operational decision making.