重新审视Dataflow Model

Lobsters Hottest 论文

摘要

这篇学术论文重新审视了Dataflow Model,可能为其理论基础和在数据管理系统中的应用提供了新的见解或更新。

<p>摘要</p> <p>十一年前,Dataflow Model论文提出,无界、乱序数据是新常态,我们必须停止等待数据永远变得完整。它提出了一个统一模型(窗口化、触发器、水印和撤回),用于在批处理和流处理引擎中自由权衡正确性、延迟和成本。在获得VLDB时间检验奖之际,我们评估我们自己的工作——一篇关于流处理分析的论文,名不副实——哪些部分经受住了时间的考验,哪些部分老化得不好,以及我们错过了什么。</p> <p>我们发现论文的核心基础基本健全:事件时间的首要性、等待完整性的徒劳以及强一致性的坚持都经受住了时间的考验。但我们在分析接口的重要部分上犯了错误:(1)我们让窗口化和触发器的语义与操作问题纠缠不清,主导了阐述超出了它们应有的程度,(2)触发器是对用户不应面临的问题的过度工程化解答,(3)以流为中心的世界观错过了一个更深层的真相:流和表是同一对象的不同表示,具有不同的访问语义。实现论文分析目标的机制最终从数据库的策略中演变而来:SQL、增量视图维护和具有显式新鲜度合约的物化视图。我们过于专注于流处理的机制,而不是完成数据库社区开始但从未完成的工作:让分析流的复杂性几乎完全消失。尽管如此,判决并非全是忏悔。我们探讨完整性原则如何分裂成两种成功形式:水印(流保持可见)和快照一致性刷新(流不可见);我们追溯为什么后者通过要求更少而触及更多用户,并将前者概括为对变化的声明约束。我们还(1)发现批处理与流处理的争论主要是语义上的,(2)观察低延迟需求沿着旧的OLTP/OLAP线分叉,让分析愉快地处于更温和的新鲜度,(3)采用我们希望一开始就有的框架(保留、排除、更努力推动),(4)思考流处理最终在分析之外的消失。</p> <p><a href="https://lobste.rs/s/r5b28u/dataflow_model_revisited">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/07 18:54

来源:https://www.vldb.org/pvldb/vol19/p4953-fernandez-moctezuma.pdf (注:您提供的文本内容存在编码或提取错误,导致呈现为乱码及部分PDF结构标记。无法进行有效翻译。建议直接访问上述链接查看原始论文内容。)

相似文章

重新审视 Dataflow Model

Hacker News Top

本文重新审视了十一年前的 Dataflow Model,评估其良好和不佳的方面,并讨论了对流分析和数据处理数据库原则的见解。