data-engineering

标签

Cards List
#data-engineering

@gudanglifehack: SQL项目系列#19 物流与发货分析 分析发货、仓库、配送表现、客户等…

X AI KOLs Timeline · 2天前 缓存

一个关于构建物流和发货分析数据库的SQL教程,涵盖模式设计、示例数据以及供应链优化的关键业务KPI。

0 人收藏 0 人点赞
#data-engineering

@LangChain:我们的数据代理现在处理的请求量大约是3人数据团队直接管理的40倍。现在,我们的数据团队可以专注于模型、上下文和护栏,这些才是让代理值得信赖的根本。

X AI KOLs Timeline · 2天前 缓存

LangChain围绕一个AI代理重建了其数据堆栈,该代理处理的请求量大约是3人数据团队的40倍,实现了自助分析,并将团队的工作重点转向了模型、上下文和护栏。

0 人收藏 0 人点赞
#data-engineering

面向开发者的数据工具生态指南

Hacker News Top · 2026-07-16 缓存

这是一份为不熟悉数据工具的软件开发人员提供的全面指南,涵盖数据生命周期、数据职业和工具生态,并融合了作者在 Deepnote 和 Metabase 的经验见解。

0 人收藏 0 人点赞
#data-engineering

@floydophone: 重大消息!很高兴Dagster团队加入Prefect。

X AI KOLs Following · 2026-07-13 缓存

Prefect宣布收购Dagster,两大领先的开源数据编排平台合并。

0 人收藏 0 人点赞
#data-engineering

面向数据工程、分析与科学领域的编程代理

Reddit r/AI_Agents · 2026-07-03

介绍一款全新的编程代理,旨在辅助数据工程、分析与科学任务。

0 人收藏 0 人点赞
#data-engineering

@EcZachly: Netflix的高级数据工程师年薪可达50万美元。但面试过程非常严格:- SQL 确保你……

X AI KOLs Timeline · 2026-06-24 缓存

Zach的一条推文线程概述了Netflix高级数据工程师所需技能和面试流程,包括SQL、数据管道和系统设计,同时推广了DataExpert.io的模拟面试服务。

0 人收藏 0 人点赞
#data-engineering

@sspaeti: 数据工程花了十五年构建编排器——Airflow、Dagster、Prefect、Kestra。现在我们正在做同样的事情…

X AI KOLs Timeline · 2026-06-16 缓存

数据工程多年来一直在构建编排器,如Airflow和Dagster,现在同样的模式正在AI代理中兴起,出现了来自各大公司的Agor、Agent Teams和Omnigent等项目。

0 人收藏 0 人点赞
#data-engineering

@GitHub_Daily: GitHub 上一份精心收集的数据工程师面试题库:data-engineering-interview-questions ,收录了超过 2000 道题。 覆盖数据库与数据仓库、大数据处理框架、云平台服务、数据格式、数据可视化等核心方向,…

X AI KOLs Timeline · 2026-06-10 缓存

GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。

0 人收藏 0 人点赞
#data-engineering

@riba2534: https://x.com/riba2534/status/2062495991421616319

X AI KOLs Timeline · 2026-06-04 缓存

Anthropic分享了如何用Claude实现自助式数据分析的最佳实践,实现了95%的业务分析查询自动化,整体准确率约95%,并详细介绍了Agent分析技术栈、三种主要失败模式及应对策略。

0 人收藏 0 人点赞
#data-engineering

databow: 一个使用ADBC驱动程序查询任何数据库的Rust CLI工具

Hacker News Top · 2026-06-02 缓存

databow 是一个新的开源 Rust CLI 工具,提供统一的接口,可通过 ADBC 驱动程序查询任何数据库,支持超过30种数据库,包括 PostgreSQL、DuckDB 和 Snowflake。

0 人收藏 0 人点赞
#data-engineering

@svpino: 超快命令行工具,轻松搬运数据:$ ingestr ingest --source-uri --dest-uri Ingestr 是开源的,几乎无需配置……

X AI KOLs Following · 2026-06-01

Ingestr 是一款开源 CLI 工具,可在任何源与目标之间高速移动数据,支持众多数据库、数据仓库和 SaaS 应用。

0 人收藏 0 人点赞
#data-engineering

探索用于模型特化的自主代理数据工程

arXiv cs.CL · 2026-06-01 缓存

本文形式化了自主代理数据工程,其中LLMs作为自主数据工程师,为特定领域策划和优化训练数据,使用GPT-5.2使学生模型性能提升了57.29%。

0 人收藏 0 人点赞
#data-engineering

Show HN: Streambed – 将Postgres流式传输到S3上的Iceberg,支持Postgres Wire协议

Hacker News Top · 2026-05-31 缓存

Streambed是一个开源的CDC引擎,它将Postgres的WAL变更流式传输到S3上的Iceberg表,并内置了一个使用DuckDB的查询服务器,该服务器支持Postgres wire协议。

0 人收藏 0 人点赞
#data-engineering

@github:构建数据管道,无需复杂繁琐。明天在开源星期五,开发者倡导者 Elvis Kahoro 将解释 @dl…

X AI KOLs Following · 2026-05-28 缓存

GitHub 的“开源星期五”活动邀请了来自 dltHub 的 Elvis Kahoro,讨论 dlt——一个用于构建数据管道、无需复杂性的开源 Python 库。

0 人收藏 0 人点赞
#data-engineering

探索面向模型特化的自主代理数据工程

Hugging Face Daily Papers · 2026-05-28 缓存

本文介绍了自主代理数据工程(Autonomous Agentic Data Engineering)这一任务,其中LLM自主执行端到端的数据整理流水线以实现模型特化,并展示了显著的性能提升(例如,GPT-5.2 将学生模型提升了 57.29%)。

0 人收藏 0 人点赞
#data-engineering

@shabnam_774: https://x.com/shabnam_774/status/2058517919760355729

X AI KOLs Timeline · 2026-05-24 缓存

本文提供了关于现代大型语言模型(如ChatGPT和Claude)从零开始构建的全面逐步解析,涵盖了数据收集、分词、Transformer架构、训练、对齐和部署。

0 人收藏 0 人点赞
#data-engineering

@Teknium:我们的数据库和数据工程专家@yoniebans对会话存储和访问方式进行了重大改进……

X AI KOLs Following · 2026-05-21 缓存

针对Hermes Agent的会话存储和访问的重大改进,节省20-40%磁盘空间并提升速度。

0 人收藏 0 人点赞
#data-engineering

Quack:DuckDB 的客户端-服务器协议

Hacker News Top · 2026-05-12 缓存

DuckDB 引入了名为“Quack”的全新客户端-服务器协议,使得 DuckDB 实例能够通过 HTTP 进行通信,在支持并发写入和远程访问的同时,保持简单性与高性能。

0 人收藏 0 人点赞
#data-engineering

DataTalksClub/data-engineering-zoomcamp

GitHub Trending (daily) · 2026-05-29 缓存

DataTalksClub 正在提供免费的 9 周 Data Engineering Zoomcamp 课程,涵盖容器、编排、数据仓库、分析、批处理和流处理。

0 人收藏 0 人点赞
#data-engineering

@LakeSailHQ:用 Rust 重写的 Spark——无 JVM,速度提升 8 倍,成本降低 94%

X AI KOLs Following · 2026-04-22 缓存

LakeSail 推出 Sail,一款基于 Rust 重新实现的 Apache Spark,在保持完整 API 兼容的同时,性能提升 8 倍,基础设施成本降低 94%。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈