标签
一条推文讨论了Databricks如何简化了Spark,使得像GTM工程师这样的非专家也能在没有深入技术知识的情况下构建数据管道。
这篇博客文章详细介绍了渐进式优化,以将ClickHouse查询延迟从超过85秒降低至亚秒级,包括对分区键的修改、连接消除和激进合并。
这篇文章分享了运维PB级ClickHouse集群五年的经验教训,讨论了最佳实践,并推广Tinybird的托管数据服务。
本文提出了一种针对LLMs的神经符号层,无需微调即可将逻辑推理准确率提高8.5%,并在长上下文任务中将令牌使用量减少超过50%。
一位推特用户正在考虑是否要获取第二个 Spark 实例,这很可能指的是 Apache Spark,并希望有人能说服他。
Snowflake的工程博客详细介绍了新的Postgres数据镜像功能,该功能通过snowflake_cdc扩展将更改推送到Iceberg表中,旨在实现弹性、低延迟的事务复制。
TechAscent 展示了如何通过 tech.ml.dataset(TMD)从 Clojure 中利用 DuckDB 的高性能矢量化 SQL 引擎,实现大型内存外连接,以及约两分钟内将 50GB CSV 数据摄入并压缩至 18GB。
A comprehensive guide for software developers entering the data field, explaining the data tools landscape, key concepts, and workflows from ingestion to visualization.
这本freeCodeCamp手册教读者如何使用真实洪水数据在Python中构建生产级ETL管道,涵盖增量加载、类型强制转换、去重和幂等性。
一个关于构建物流和发货分析数据库的SQL教程,涵盖模式设计、示例数据以及供应链优化的关键业务KPI。
LangChain围绕一个AI代理重建了其数据堆栈,该代理处理的请求量大约是3人数据团队的40倍,实现了自助分析,并将团队的工作重点转向了模型、上下文和护栏。
这是一份为不熟悉数据工具的软件开发人员提供的全面指南,涵盖数据生命周期、数据职业和工具生态,并融合了作者在 Deepnote 和 Metabase 的经验见解。
Prefect宣布收购Dagster,两大领先的开源数据编排平台合并。
Zach的一条推文线程概述了Netflix高级数据工程师所需技能和面试流程,包括SQL、数据管道和系统设计,同时推广了DataExpert.io的模拟面试服务。
数据工程多年来一直在构建编排器,如Airflow和Dagster,现在同样的模式正在AI代理中兴起,出现了来自各大公司的Agor、Agent Teams和Omnigent等项目。
GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。
Anthropic分享了如何用Claude实现自助式数据分析的最佳实践,实现了95%的业务分析查询自动化,整体准确率约95%,并详细介绍了Agent分析技术栈、三种主要失败模式及应对策略。
databow 是一个新的开源 Rust CLI 工具,提供统一的接口,可通过 ADBC 驱动程序查询任何数据库,支持超过30种数据库,包括 PostgreSQL、DuckDB 和 Snowflake。
Ingestr 是一款开源 CLI 工具,可在任何源与目标之间高速移动数据,支持众多数据库、数据仓库和 SaaS 应用。