标签
Flux-OPD 提出了一种同策略蒸馏范式,利用演化上下文作为训练中的监督信号,以捕获开放领域中的任务偏好,优于现有的 OPD 范式。
本文提出了Detect–Remask–Repair,一种基于扩散的框架,用于在上下文演变时进行摘要中的局部忠实性修复,并引入了StreamSum基准来评估此类设置。实验表明,它在忠实性、速度和内容保留之间提供了可控的权衡。