重新审视Dataflow Model
摘要
这篇学术论文重新审视了Dataflow Model,可能为其理论基础和在数据管理系统中的应用提供了新的见解或更新。
<p>摘要</p>
<p>十一年前,Dataflow Model论文提出,无界、乱序数据是新常态,我们必须停止等待数据永远变得完整。它提出了一个统一模型(窗口化、触发器、水印和撤回),用于在批处理和流处理引擎中自由权衡正确性、延迟和成本。在获得VLDB时间检验奖之际,我们评估我们自己的工作——一篇关于流处理分析的论文,名不副实——哪些部分经受住了时间的考验,哪些部分老化得不好,以及我们错过了什么。</p>
<p>我们发现论文的核心基础基本健全:事件时间的首要性、等待完整性的徒劳以及强一致性的坚持都经受住了时间的考验。但我们在分析接口的重要部分上犯了错误:(1)我们让窗口化和触发器的语义与操作问题纠缠不清,主导了阐述超出了它们应有的程度,(2)触发器是对用户不应面临的问题的过度工程化解答,(3)以流为中心的世界观错过了一个更深层的真相:流和表是同一对象的不同表示,具有不同的访问语义。实现论文分析目标的机制最终从数据库的策略中演变而来:SQL、增量视图维护和具有显式新鲜度合约的物化视图。我们过于专注于流处理的机制,而不是完成数据库社区开始但从未完成的工作:让分析流的复杂性几乎完全消失。尽管如此,判决并非全是忏悔。我们探讨完整性原则如何分裂成两种成功形式:水印(流保持可见)和快照一致性刷新(流不可见);我们追溯为什么后者通过要求更少而触及更多用户,并将前者概括为对变化的声明约束。我们还(1)发现批处理与流处理的争论主要是语义上的,(2)观察低延迟需求沿着旧的OLTP/OLAP线分叉,让分析愉快地处于更温和的新鲜度,(3)采用我们希望一开始就有的框架(保留、排除、更努力推动),(4)思考流处理最终在分析之外的消失。</p>
<p><a href="https://lobste.rs/s/r5b28u/dataflow_model_revisited">评论</a></p>
查看缓存全文
缓存时间: 2026/09/07 18:54
来源:https://www.vldb.org/pvldb/vol19/p4953-fernandez-moctezuma.pdf
(注:您提供的文本内容存在编码或提取错误,导致呈现为乱码及部分PDF结构标记。无法进行有效翻译。建议直接访问上述链接查看原始论文内容。)
相似文章
重新审视 Dataflow Model
本文重新审视了十一年前的 Dataflow Model,评估其良好和不佳的方面,并讨论了对流分析和数据处理数据库原则的见解。
DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化的LLM驱动框架
DataFlow是一个LLM驱动的框架,用于自动化数据准备和工作流工程,具备近200个可复用算子和六个领域通用流程,可在数学、代码和Text-to-SQL等任务上提升LLM性能。
FLUX 3 - 现实世界模型:迈向多模态流模型作为视觉智能的骨干
FLUX 3 提出了多模态流模型作为现实世界视觉智能的基础方法,建立在之前的 FLUX 工作之上。
重新思考数据护城河(6分钟阅读)
文章讨论了在AI发展中,数据与算法进步之间重要性的演变,借鉴研究人员的近期演讲,以强调焦点的转变。
@r_de_santi: 生成模型无法发现它们无法触及的东西。我们很高兴推出 ActFlow:一个持续预训练方案…
本文介绍了 ActFlow,这是一种持续预训练方案,旨在扩展流模型和扩散模型的有效设计空间,从而实现分布外生成建模,并为科学发现提供可进化的搜索空间。