data-engineering

标签

Cards List
#data-engineering

@JohnKutay:一年前,我们需要聘请Databricks专家来构建Spark作业。现在,我们有GTM工程师在构建数据管道……

X AI KOLs Following · 2天前 缓存

一条推文讨论了Databricks如何简化了Spark,使得像GTM工程师这样的非专家也能在没有深入技术知识的情况下构建数据管道。

0 人收藏 0 人点赞
#data-engineering

毫秒必争

Lobsters Hottest · 5天前 缓存

这篇博客文章详细介绍了渐进式优化,以将ClickHouse查询延迟从超过85秒降低至亚秒级,包括对分区键的修改、连接消除和激进合并。

0 人收藏 0 人点赞
#data-engineering

我运维PB级ClickHouse集群已五年

Hacker News Top · 2026-09-07 缓存

这篇文章分享了运维PB级ClickHouse集群五年的经验教训,讨论了最佳实践,并推广Tinybird的托管数据服务。

0 人收藏 0 人点赞
#data-engineering

神经符号学在数据工程中的应用:无需微调实现长上下文令牌缩减

arXiv cs.CL · 2026-09-02 缓存

本文提出了一种针对LLMs的神经符号层,无需微调即可将逻辑推理准确率提高8.5%,并在长上下文任务中将令牌使用量减少超过50%。

0 人收藏 0 人点赞
#data-engineering

@no_stp_on_snek: 真的在考虑获取第二个 Spark。说服我!(注意这不会很难)

X AI KOLs Following · 2026-08-23 缓存

一位推特用户正在考虑是否要获取第二个 Spark 实例,这很可能指的是 Apache Spark,并希望有人能说服他。

0 人收藏 0 人点赞
#data-engineering

我们如何将CDC推送到Postgres

Hacker News Top · 2026-08-10 缓存

Snowflake的工程博客详细介绍了新的Postgres数据镜像功能,该功能通过snowflake_cdc扩展将更改推送到Iceberg表中,旨在实现弹性、低延迟的事务复制。

0 人收藏 0 人点赞
#data-engineering

DuckDB – 笔记本电脑上的数据强力工具,现已支持 Clojure(2023)

Hacker News Top · 2026-08-04 缓存

TechAscent 展示了如何通过 tech.ml.dataset(TMD)从 Clojure 中利用 DuckDB 的高性能矢量化 SQL 引擎,实现大型内存外连接,以及约两分钟内将 50GB CSV 数据摄入并压缩至 18GB。

0 人收藏 0 人点赞
#data-engineering

@PythonHub: Guide to data tools landscape for developers Found yourself on a data project and have no idea what they all are talkin…

X AI KOLs Timeline · 2026-07-31 缓存

A comprehensive guide for software developers entering the data field, explaining the data tools landscape, key concepts, and workflows from ingestion to visualization.

0 人收藏 0 人点赞
#data-engineering

@freeCodeCamp: 生产级ETL管道需要保持可靠运行,即使数据混乱或API失败。在本手册中,Brookly…

X AI KOLs Timeline · 2026-07-31 缓存

这本freeCodeCamp手册教读者如何使用真实洪水数据在Python中构建生产级ETL管道,涵盖增量加载、类型强制转换、去重和幂等性。

0 人收藏 0 人点赞
#data-engineering

@gudanglifehack: SQL项目系列#19 物流与发货分析 分析发货、仓库、配送表现、客户等…

X AI KOLs Timeline · 2026-07-29 缓存

一个关于构建物流和发货分析数据库的SQL教程,涵盖模式设计、示例数据以及供应链优化的关键业务KPI。

0 人收藏 0 人点赞
#data-engineering

@LangChain:我们的数据代理现在处理的请求量大约是3人数据团队直接管理的40倍。现在,我们的数据团队可以专注于模型、上下文和护栏,这些才是让代理值得信赖的根本。

X AI KOLs Timeline · 2026-07-28 缓存

LangChain围绕一个AI代理重建了其数据堆栈,该代理处理的请求量大约是3人数据团队的40倍,实现了自助分析,并将团队的工作重点转向了模型、上下文和护栏。

0 人收藏 0 人点赞
#data-engineering

面向开发者的数据工具生态指南

Hacker News Top · 2026-07-16 缓存

这是一份为不熟悉数据工具的软件开发人员提供的全面指南,涵盖数据生命周期、数据职业和工具生态,并融合了作者在 Deepnote 和 Metabase 的经验见解。

0 人收藏 0 人点赞
#data-engineering

@floydophone: 重大消息!很高兴Dagster团队加入Prefect。

X AI KOLs Following · 2026-07-13 缓存

Prefect宣布收购Dagster,两大领先的开源数据编排平台合并。

0 人收藏 0 人点赞
#data-engineering

面向数据工程、分析与科学领域的编程代理

Reddit r/AI_Agents · 2026-07-03

介绍一款全新的编程代理,旨在辅助数据工程、分析与科学任务。

0 人收藏 0 人点赞
#data-engineering

@EcZachly: Netflix的高级数据工程师年薪可达50万美元。但面试过程非常严格:- SQL 确保你……

X AI KOLs Timeline · 2026-06-24 缓存

Zach的一条推文线程概述了Netflix高级数据工程师所需技能和面试流程,包括SQL、数据管道和系统设计,同时推广了DataExpert.io的模拟面试服务。

0 人收藏 0 人点赞
#data-engineering

@sspaeti: 数据工程花了十五年构建编排器——Airflow、Dagster、Prefect、Kestra。现在我们正在做同样的事情…

X AI KOLs Timeline · 2026-06-16 缓存

数据工程多年来一直在构建编排器,如Airflow和Dagster,现在同样的模式正在AI代理中兴起,出现了来自各大公司的Agor、Agent Teams和Omnigent等项目。

0 人收藏 0 人点赞
#data-engineering

@GitHub_Daily: GitHub 上一份精心收集的数据工程师面试题库:data-engineering-interview-questions ,收录了超过 2000 道题。 覆盖数据库与数据仓库、大数据处理框架、云平台服务、数据格式、数据可视化等核心方向,…

X AI KOLs Timeline · 2026-06-10 缓存

GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。

0 人收藏 0 人点赞
#data-engineering

@riba2534: https://x.com/riba2534/status/2062495991421616319

X AI KOLs Timeline · 2026-06-04 缓存

Anthropic分享了如何用Claude实现自助式数据分析的最佳实践,实现了95%的业务分析查询自动化,整体准确率约95%,并详细介绍了Agent分析技术栈、三种主要失败模式及应对策略。

0 人收藏 0 人点赞
#data-engineering

databow: 一个使用ADBC驱动程序查询任何数据库的Rust CLI工具

Hacker News Top · 2026-06-02 缓存

databow 是一个新的开源 Rust CLI 工具,提供统一的接口,可通过 ADBC 驱动程序查询任何数据库,支持超过30种数据库,包括 PostgreSQL、DuckDB 和 Snowflake。

0 人收藏 0 人点赞
#data-engineering

@svpino: 超快命令行工具,轻松搬运数据:$ ingestr ingest --source-uri --dest-uri Ingestr 是开源的,几乎无需配置……

X AI KOLs Following · 2026-06-01

Ingestr 是一款开源 CLI 工具,可在任何源与目标之间高速移动数据,支持众多数据库、数据仓库和 SaaS 应用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈