标签
一个关于构建物流和发货分析数据库的SQL教程,涵盖模式设计、示例数据以及供应链优化的关键业务KPI。
LangChain围绕一个AI代理重建了其数据堆栈,该代理处理的请求量大约是3人数据团队的40倍,实现了自助分析,并将团队的工作重点转向了模型、上下文和护栏。
这是一份为不熟悉数据工具的软件开发人员提供的全面指南,涵盖数据生命周期、数据职业和工具生态,并融合了作者在 Deepnote 和 Metabase 的经验见解。
Prefect宣布收购Dagster,两大领先的开源数据编排平台合并。
Zach的一条推文线程概述了Netflix高级数据工程师所需技能和面试流程,包括SQL、数据管道和系统设计,同时推广了DataExpert.io的模拟面试服务。
数据工程多年来一直在构建编排器,如Airflow和Dagster,现在同样的模式正在AI代理中兴起,出现了来自各大公司的Agor、Agent Teams和Omnigent等项目。
GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。
Anthropic分享了如何用Claude实现自助式数据分析的最佳实践,实现了95%的业务分析查询自动化,整体准确率约95%,并详细介绍了Agent分析技术栈、三种主要失败模式及应对策略。
databow 是一个新的开源 Rust CLI 工具,提供统一的接口,可通过 ADBC 驱动程序查询任何数据库,支持超过30种数据库,包括 PostgreSQL、DuckDB 和 Snowflake。
Ingestr 是一款开源 CLI 工具,可在任何源与目标之间高速移动数据,支持众多数据库、数据仓库和 SaaS 应用。
本文形式化了自主代理数据工程,其中LLMs作为自主数据工程师,为特定领域策划和优化训练数据,使用GPT-5.2使学生模型性能提升了57.29%。
Streambed是一个开源的CDC引擎,它将Postgres的WAL变更流式传输到S3上的Iceberg表,并内置了一个使用DuckDB的查询服务器,该服务器支持Postgres wire协议。
GitHub 的“开源星期五”活动邀请了来自 dltHub 的 Elvis Kahoro,讨论 dlt——一个用于构建数据管道、无需复杂性的开源 Python 库。
本文介绍了自主代理数据工程(Autonomous Agentic Data Engineering)这一任务,其中LLM自主执行端到端的数据整理流水线以实现模型特化,并展示了显著的性能提升(例如,GPT-5.2 将学生模型提升了 57.29%)。
本文提供了关于现代大型语言模型(如ChatGPT和Claude)从零开始构建的全面逐步解析,涵盖了数据收集、分词、Transformer架构、训练、对齐和部署。
针对Hermes Agent的会话存储和访问的重大改进,节省20-40%磁盘空间并提升速度。
DuckDB 引入了名为“Quack”的全新客户端-服务器协议,使得 DuckDB 实例能够通过 HTTP 进行通信,在支持并发写入和远程访问的同时,保持简单性与高性能。
DataTalksClub 正在提供免费的 9 周 Data Engineering Zoomcamp 课程,涵盖容器、编排、数据仓库、分析、批处理和流处理。
LakeSail 推出 Sail,一款基于 Rust 重新实现的 Apache Spark,在保持完整 API 兼容的同时,性能提升 8 倍,基础设施成本降低 94%。