TailBooster:一种面向极端值增强且强制执行运行有效性的双层生成框架

Hugging Face Daily Papers 论文

摘要

TailBooster是一种双层生成框架,通过统计尾部提取和基于自编码器的清洗来合成运行上有效的极端航空运输事件,显著提高了极端事件预测的准确性。

航空运输中的极端事件,例如严重的到达延误和异常空中时间,会造成级联的网络中断,带来巨大的运行、经济和安全隐患。此类事件在历史记录中很少见,导致机器学习模型的训练信号不足。合成数据增强提供了一种原则性的解决方案,但传统的生成模型对分布尾部的表示不足,并且无法保证避免运行上不可行的实例,例如短空中时间与长飞行距离的配对。对于混合类型的表格记录,现有方法均未同时解决这两个局限性。我们提出了TailBooster,这是一种双层生成框架,将生成建模与两个异常检测层相结合。统计层通过四分位距提取极端值,为专用生成模型(此处为表格变分自编码器)提供集中于尾部的训练信号。深度学习层随后应用基于自编码器的清洗,丢弃违反从历史数据中学习到的运行包络的合成记录。该框架在美国航班记录上进行了评估,涵盖五个维度:多样性、统计相似性、保真度、运行有效性和实用性,其中后两者是主要的改进目标。数据驱动的清洗显著提高了运行有效性,而针对性增强则提升了极端事件预测的实用性。在六种回归算法中,与常规合成数据相比,基于该框架记录的训练使极端空中时间的平均绝对误差降低了47%至49%,极端到达延误预测的平均绝对误差降低了29%至57%;当真实记录加入合成极端值时,也获得了类似的提升。由于完全数据驱动且与模型无关,TailBooster可扩展到那些极端事件预测至关重要且缺乏领域特定规则的领域。
查看原文
查看缓存全文

缓存时间: 2026/08/14 11:27

论文页面 - TailBooster:一种双层生成框架,用于极值增强并强制操作可行性

来源: https://huggingface.co/papers/2608.11951

摘要

TailBooster 采用双层生成框架,结合统计尾部提取和深度自编码器清洗,合成操作上有效的极端航空运输事件,显著提升了极端事件预测的准确性。

航空运输中的极端事件(如严重到达延误和异常空中时间)会引发级联式网络中断,带来巨大的运营、经济和安全成本。这类事件在历史记录中十分罕见,导致机器学习模型缺乏足够的训练信号。合成数据增强(https://huggingface.co/papers?q=Synthetic%20data%20augmentation)提供了一种原理上可行的解决方案,但传统生成模型对分布尾部表达不足,并且无法保证不会生成操作上不可行的实例,例如短空中时间搭配长飞行距离。现有方法均无法同时解决混合类型表格记录中的这两个局限性。我们提出 TailBooster,一个双层生成框架,将生成建模与两个异常检测层相结合。统计层通过四分位距(https://huggingface.co/papers?q=interquartile%20range)提取极端值,为专门的生成模型(此处为表格变分自编码器(https://huggingface.co/papers?q=Tabular%20Variational%20Autoencoder))提供集中于尾部的训练信号。随后,深度学习层应用基于自编码器的清洗(https://huggingface.co/papers?q=autoencoder-based%20cleaning),丢弃那些违反从历史数据中学习到的操作边界的合成记录。该框架在美国航班记录上从五个维度进行了评估:多样性、统计相似性、保真度、操作有效性(https://huggingface.co/papers?q=operational%20validity)以及效用,其中后两者是主要的改进目标。数据驱动的清洗显著提升了操作有效性(https://huggingface.co/papers?q=operational%20validity),而针对性增强则提升了极端事件预测(https://huggingface.co/papers?q=extreme-event%20prediction)的效用。在六种回归算法上,相对于传统合成数据,使用该框架生成的记录进行训练,使极端空中时间的平均绝对误差降低了 47-49%,极端到达延误预测的平均绝对误差降低了 29-57%;当用合成极端值丰富真实记录时,也获得了类似的提升。TailBooster 完全由数据驱动且与模型无关,可扩展到极端事件预测(https://huggingface.co/papers?q=extreme-event%20prediction)至关重要且缺乏特定领域规则的领域。

查看 arXiv 页面(https://arxiv.org/abs/2608.11951)查看 PDF(https://arxiv.org/pdf/2608.11951)项目页面(https://www.sesarju.eu/projects/SynthAIR)添加到收藏集(https://huggingface.co/login?next=%2Fpapers%2F2608.11951)

在您的 agent 中获取此论文:

hf papers read 2608\.11951

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型链接到此论文

在模型 README.md 中引用 arxiv.org/abs/2608.11951 即可从此页面链接该模型。

引用此论文的数据集0

没有数据集链接到此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.11951 即可从此页面链接该数据集。

引用此论文的 Space0

没有 Space 链接到此论文

在 Space README.md 中引用 arxiv.org/abs/2608.11951 即可从此页面链接该 Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection)以从此页面链接它。

相似文章

Tail-Likelihood Reinforcement Learning

arXiv cs.LG

该论文提出了一种名为 Tail-Likelihood Reinforcement Learning (TailRL) 的优化方法,该方法专注于奖励分布的上尾部分,以改善生成任务中的策略性能,并在多种应用中进行了演示。

OpenLongTail:长尾驾驶数据的生成式扩展

Hugging Face Daily Papers

OpenLongTail 是一个开源生成式数据引擎,能将异构的长尾驾驶数据转化为视角对齐的多视角资产,用于训练鲁棒的自动驾驶策略,提升闭环驾驶的鲁棒性。

双重评分:可靠提取强彩票子网络

arXiv cs.LG

本文引入了双重评分,一种增强的得分空间参数化方法,用于从神经网络中提取强彩票子网络。该方法改进了edge-popup和初始剪枝基线,并降低了对稀疏性超参数的敏感性。

无需极端数据生成极端事件场景

MIT News — Artificial Intelligence

MIT工程师开发了一种名为Extreme Event Aware的机器学习算法,该算法无需依赖历史极端数据即可生成合理的极端事件场景,有助于天气和金融等领域的风险评估。