@gp_pulipaka: Databricks Delta Sharing! #BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM #IoT #IIoT #PyTorch #Pytho…
摘要
Databricks Delta Sharing 是一个开放协议,能够实现跨云提供商的安全、实时数据共享,无需复制,减少出站成本并简化多云数据访问。
查看缓存全文
缓存时间: 2026/07/27 17:55
Databricks Delta Sharing! #大数据 #分析 #数据科学 #AI #机器学习 #自然语言处理 #大语言模型 #物联网 #工业物联网 #PyTorch #Python #R语言 #TensorFlow #Java #JavaScript #ReactJS #Go语言 #云计算 #无服务器 #数据科学家 #Linux #编程 #编码 #100天代码挑战 https://geni.us/DataBricks-Delta…
Databricks Delta Sharing:实现跨云数据的高效成本访问
来源:https://techcommunity.microsoft.com/blog/azurearchitectureblog/databricks-delta-sharing-enabling-cost-efficient-cross-cloud-data-access/4511400 Delta Sharing(https://learn.microsoft.com/zh-cn/azure/databricks/delta-sharing/)是一种开放安全数据共享协议,允许组织将存储在 Delta Lake 中的实时数据与外部消费者共享——跨越 Azure、AWS 和 Google Cloud 等云提供商——同时将数据保留在原始位置。消费者访问相同的实时数据,而提供方无需将数据复制或移动到其他云。
在多云环境中,数据共享通常会导致存储重复增加和跨云数据传输费用。Delta Sharing 通过就地暴露数据来改变这一模式,实现访问而非复制。
关键架构优势包括:
- 无需复制的跨云数据可用性 数据生产者直接从其现有数据湖共享表,消除了提取-加载管道的需求。
- 与基于复制的方法相比,降低了出站成本 由于默认不会复制数据,Delta Sharing 避免了通常导致云出站费用的大规模数据移动。仅当跨云查询数据时才会产生出站流量。
- 安全且受治理的访问 通过细粒度权限、可审计性和通过 Unity Catalog 的集中治理来管理访问,确保共享数据保持安全合规。
- 供应商中立且开放 消费者无需运行 Databricks。Delta Sharing 支持多种客户端,如 Spark、Pandas 和 BI 工具,适用于异构分析生态系统。
一个常见的误解是跨云分析总是需要数据复制。使用 Delta Sharing:
- 实时访问 用于共享分析和报告用例
- 复制(深克隆) 仅在需要本地副本或离线处理时作为明确的设计选择,而非默认要求
这为架构师提供了灵活性,可以根据工作负载优化成本、性能或隔离性,而无需预先支付复制成本。
图:Databricks Delta Sharing 架构:
Delta Sharing 能够在无需复制数据的情况下,跨公共云实现安全、实时的数据访问。消费者通过安全控制平面就地查询数据,确保治理、降低运营开销并优化出站成本。
此图以从左到右的清晰流程直观展示了 Databricks Delta Sharing 架构,适合博客和技术读者阅读:
- 左侧 – 数据生产者(Azure Databricks + Unity Catalog + Delta Lake 存储)
- 中间 – Delta Sharing 服务(安全控制平面、元数据和访问控制)
- 右侧 – 数据消费者(AWS / GCP / Spark / BI 工具 / Pandas)
- 底部流程 – 只读、按需访问,无数据复制且仅读取时产生出站流量
概述
该图说明了 Databricks Delta Sharing 如何在无需复制数据的情况下,跨公共云(Azure、AWS、GCP)实现安全、实时的数据访问,有助于降低运营开销和数据出站成本。
在高层次上,数据保留在生产者云存储中,而其他云中的消费者使用 Delta Sharing 协议安全按需访问数据
1️⃣ 数据生产者(Azure Databricks)
- 数据提供方在 Delta Lake 中托管精选数据集(例如,在 Azure Data Lake Storage Gen2 上)。
- 数据通过 Unity Catalog 进行治理,它控制:
共享过程中不会复制或导出任何数据——数据集保留在提供方的存储帐户中。
2️⃣ Delta Sharing 服务(控制平面)
- Delta Sharing 作为 安全控制层,而非数据存储层。
- 它管理:
控制平面确保只有授权消费者才能发现和查询共享数据集。
3️⃣ 安全网络访问
- 消费者通过 基于 HTTPS 的安全端点 连接到生产者的存储。
- 根据架构不同:
所有访问都在数据生产者定义的治理策略下进行。
4️⃣ 数据消费者(AWS / GCP / Azure)
- 消费者可能运行:
消费者就地查询数据,直接从生产者的 Delta 表中读取
重要的是,除非消费者明确选择,否则无需复制或本地存储数据。
5️⃣ 数据流(只读、按需)
- 当消费者运行查询时:
这种“访问而非复制”模型避免了连续的数据同步管道,并最大限度地减少了不必要的数据移动。
6️⃣ 成本优化与出站考量
- 无默认数据复制意味着:
- 数据出站费用仅在实际跨云读取数据时产生,而非预先或持续发生。
与传统的基于复制的共享相比,这显著降低了许多分析工作负载的整体出站负担
7️⃣ 可选:本地复制(明确选择)
- 如果需要,消费者可以执行深克隆,将本地副本带入自己的云中。
- 这是一个明确的架构决策,仅用于以下情况:
复制是可选的——并非共享的前提条件。
Delta Sharing 特别适用于:
- 跨云平台共享精选数据集
- 无需数据复制即可实现合作伙伴或第三方分析
- 支持集中式数据平台,同时允许分散式消费
- 减少跨云数据生态系统中的运营开销
Databricks Delta Sharing 使组织能够无需数据复制即可提供安全、实时的跨云数据访问——有助于降低多云架构中的运营复杂性和出站成本。
相似文章
Databricks 推出 LTAP:统一的 OLAP/OLTP 数据架构
Databricks 推出 LTAP(湖事务/分析处理),这是一种新的架构,在数据湖中基于单一数据副本统一 OLAP 和 OLTP,消除 ETL 管道,并由 Lakebase 提供支持。这为 AI 应用时代的操作数据、分析数据和流数据提供了单一受管的基础。
@gp_pulipaka: Perplexity 的 Bumblebee Pipeline!@perplexity_ai #BigData #Analytics #DataScience #AI #MachineLearning #NLProc #LLM #IoT…
Perplexity AI 宣布推出 Bumblebee Pipeline,这是一个用于大数据和 AI 工作流的工具,由知名 AI 影响者 gp_pulipaka 分享。
在 Databricks 数百万行代码库上评估编码智能体
Databricks 分享了在其数百万行代码库上评估编码智能体的内部基准测试结果,揭示了能力层级和成本性能权衡,并强调了像 GLM 5.2 这样的开源模型的有效性。
Databricks估值达到1880亿美元,延续其作为AI最受欢迎的第二幕的势头
Databricks宣布新一轮融资,估值达1880亿美元,延续其融资势头,并将自身定位为领先的AI提供商。
将Postgres数据以Parquet格式存储在S3上:LTAP架构解析
Databricks推出Lakebase LTAP架构,将Postgres数据以Parquet格式存储在S3上,无需CDC或镜像即可在单份数据上实现事务与分析。