Databricks 推出 LTAP:统一的 OLAP/OLTP 数据架构
摘要
Databricks 推出 LTAP(湖事务/分析处理),这是一种新的架构,在数据湖中基于单一数据副本统一 OLAP 和 OLTP,消除 ETL 管道,并由 Lakebase 提供支持。这为 AI 应用时代的操作数据、分析数据和流数据提供了单一受管的基础。
暂无内容
查看缓存全文
缓存时间: 2026/06/16 20:35
# Databricks 推出 LTAP:首个湖事务与分析处理架构
来源:https://www.databricks.com/company/newsroom/press-releases/databricks-launches-ltap-first-lake-transactionalanalytical
- Databricks 今日发布 LTAP(湖事务与分析处理),一种新的数据处理架构,将 OLAP 和 OLTP 统一在湖中的单一数据副本上,从根本上消除了 ETL、副本和管道。
- Lakebase 作为 LTAP 架构的基础,现已服务数千客户,每天在平台上处理 1200 万次数据库启动。
- Databricks 是全球首个 LTAP 平台。它将 Lakebase(基于开放对象存储的无服务器 Postgres)与 Lakehouse 结合,采用统一的治理模型、单一事实来源和存储层,覆盖所有运营、分析和流数据。
**DATA + AI SUMMIT – 2026 年 6 月 16 日** – Databricks (https://www.databricks.com/),数据与 AI 公司,今日正式推出 Lake Transactional/Analytical Processing (LTAP) ——一种新的数据处理架构,将事务、分析、流和运营数据统一在湖中的单一存储副本上。借助 LTAP,企业拥有一个统一的受治理基础,可以读取、推理和操作,无需管道、副本或数十年来定义数据基础设施的 ETL 开销。由 Lakebase 的重大进展驱动,LTAP 为 AI 应用时代提供了新的数据基础。
**智能体时代的新数据基础**
四十年来,事务和分析工作负载一直位于独立的系统中:运营数据库服务于应用,分析系统回答问题。连接两者意味着构建 CDC 管道,这些管道脆弱且在高负载下容易崩溃。当人类以人类速度编写软件时,这已经是一个糟糕的权衡。今天,AI 帮助开发者编写的应用数量比以往增加了约 50 倍,其中许多由智能体驱动,需要近乎实时地读取、推理和操作数据。旧架构并不适合这种情况。
数据行业之前曾试图解决系统分散的问题。HTAP 承诺在单一引擎中统一事务和分析数据,但在此过程中丧失了工作负载隔离,削弱了两者的性能,并给组织留下了庞大且昂贵的专有足迹。Zero ETL 采取了不同的方法,隐藏了 CDC 管道而非消除它。底层架构问题依然存在。
LTAP 采取了根本不同的方法:它不是将两种工作负载强制塞入一个引擎或隐藏管道,而是在存储层统一数据。所有运营数据立即可查询,并可在湖中用于分析,无需管道。事务和分析工作负载独立扩展,具有完整的性能和严格的隔离。而且由于 LTAP 基于开放标准构建,它可以与任何支持 Postgres 的应用以及任何理解开放表格式(如 Iceberg 和 Delta)的读取器配合使用。
*“几十年来,复杂的数据基础设施是团队必须缴纳的税款,”Databricks 联合创始人兼首席执行官 Ali Ghodsi 表示。“然后智能体出现了。在几个月内,组织的劳动力实际上翻了一番,但不是通过人类。智能体以人类团队永远无法达到的速度编写代码、拨打电话和运行循环。驱动上一个计算时代的基础设施现在已成为无人能承受的瓶颈。LTAP 移除了它。”*
**Lakebase 新增灾难恢复、Git 风格分支和快照**
迈向 LTAP 的第一步是 Lakebase,它将为 Postgres 原生事务引入对象存储,即与 Lakehouse 相同的层。通过将计算与存储分离,Lakebase 改变了同时运行数千个应用和智能体的经济性。去年刚刚推出的 Lakebase 已经服务于数千客户,包括 Block、Ensemble、Superhuman 和 Zillow,每天处理 1200 万次数据库启动。
今天,Databricks 宣布了新的功能,将 Lakebase 扩展到企业级 AI 规模。新的跨云、跨区域灾难恢复使组织能够构建更具弹性的数据架构,这在智能体承担关键任务运营时变得越来越重要。此外,新的 Git 风格分支和快照允许针对生产数据进行安全实验,而自主数据库操作让智能体能够监控健康状况、检测减速、建议索引并协助恢复。
**LTAP 如何完善架构**
Lakebase 和 Lakehouse 已经共享了一个存储层,但各自以独立格式维护自己的数据副本。LTAP 填补了这一差距。Lakebase 直接将数据存储在 Unity Catalog 中,使用与 Lakehouse 相同的开放格式。结果是一个更简洁的架构,由三个属性定义,共同消除了数十年来定义企业数据基础设施的权衡:
- **统一治理,单一事实来源**:所有运营、分析和流数据都以开放格式(Delta 和 Iceberg)存储在开放对象存储上,无需转换或降级。一切通过 Unity Catalog 进行治理,具有单一身份、权限和审计模型,因此每个引擎读取相同的副本,智能体共享一个统一的受治理表面进行操作。
- **无性能权衡,适用于任何工作负载**:事务工作负载在标准 Postgres 中运行,具有完整的 ACID 语义。分析工作负载在完整的 Lakehouse 上以任意规模和并发运行。两者独立扩展,并且由于系统之间没有数据移动,运营和分析结果始终同步——没有副本或影子基础设施。
- **无 ETL 管道(甚至隐藏的也没有)**:没有同步运营和分析存储的管道,没有需要维护的副本,也没有在系统之间移动数据的连接器。该架构完全消除了 ETL 层,降低了保持系统同步的运营成本,同时确保数据保持最新。
*“对于我们服务的医疗系统,收入周期中的速度和准确性直接影响他们提供护理的能力,”Ensemble 首席技术官 Grant Veazey 表示。“我们与 Databricks 的早期投资帮助我们建立了一个受治理的基础,支持超过两 PB 的干净、统一的收入周期数据。Lakebase 和 LTAP 通过在一个层上统一运营和分析工作负载扩展了该基础,使我们的 RCM 原生 AI 能够在实时运营中获取所需的实时访问。这为供应商带来了更强的财务表现,并让更多回收的收入回流到急诊科、NICU 和其他关键护理服务中。”*
**可用性**
LTAP 即将作为 Lakebase 的一部分推出。
**关于 Databricks**
Databricks 是一家数据与 AI 公司。全球超过 20,000 家组织——包括 adidas、AT&T、Bayer、Block、Mastercard、Rivian、Unilever 以及 70% 的财富 500 强企业——依赖 Databricks 构建和扩展数据与 AI 应用、分析和智能体。Databricks 总部位于旧金山,在全球拥有 30 多个办事处,提供统一的平台,包括 Lakebase、Genie、Agent Bricks、Lakeflow、Lakehouse 和 Unity Catalog。了解更多信息,请关注 Databricks 的 LinkedIn (https://www.linkedin.com/company/databricks)、X (https://x.com/databricks)、YouTube (https://www.youtube.com/@Databricks) 和 Instagram (https://www.instagram.com/databricksinc/?hl=en)。
相似文章
将Postgres数据以Parquet格式存储在S3上:LTAP架构解析
Databricks推出Lakebase LTAP架构,将Postgres数据以Parquet格式存储在S3上,无需CDC或镜像即可在单份数据上实现事务与分析。
@gp_pulipaka: Databricks Delta Sharing! #BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM #IoT #IIoT #PyTorch #Pytho…
Databricks Delta Sharing 是一个开放协议,能够实现跨云提供商的安全、实时数据共享,无需复制,减少出站成本并简化多云数据访问。
构建数据代理
探讨从文本转SQL到自主数据代理的演变,比较了使用LangGraph自定义构建的代理与Snowflake Cortex Analyst、Databricks Genie和PowerBI Copilot等托管平台。
DataFlow:面向数据为中心AI时代的统一数据准备与工作流自动化的LLM驱动框架
DataFlow是一个LLM驱动的框架,用于自动化数据准备和工作流工程,具备近200个可复用算子和六个领域通用流程,可在数学、代码和Text-to-SQL等任务上提升LLM性能。
TwinBI:面向商业智能仪表盘高效增强交互的代理式数字孪生体
TwinBI是一个框架,它将基于LLM的智能体与可执行的BI仪表盘状态耦合,以在多步分析交互中保持一致性,从而在基准测试中提高准确率并降低超时率。