标签
本文展示了利用 Hyparquet JavaScript 阅读器和 HTTP 范围请求,从单个 Parquet 数据立方体构建快速下钻仪表板的方法,从而无需使用传统数据库。
DuckDB 在 v2.0 中为 Parquet 和 CSV 文件引入异步 I/O,通过避免在数据获取期间阻塞工作线程来提升远程存储查询性能。
DuckDB的file_row_number选项用于分页读取Parquet文件时,比使用LIMIT/OFFSET快2.53倍,因为它利用行组元数据跳过不相关的数据块,但这一优势依赖于存在多个行组。
这篇博客文章介绍了 Apache Parquet 的一项优化,用于高效存储和解码像向量嵌入这样的定长列表,通过绕过固定大小数据页的 Dremel 重构,实现了与扁平列相当的解码性能。
Databricks推出Lakebase LTAP架构,将Postgres数据以Parquet格式存储在S3上,无需CDC或镜像即可在单份数据上实现事务与分析。
一位开发者分享了他们为跑步应用构建兴趣点功能的经历,使用了Geonames数据、DuckDB以及Claude的AI辅助,遇到了偏见和幻觉的挑战。
GreptimeDB的Mito2存储引擎采用LSM-tree设计,结合列式Parquet SST、三级扫描剪枝以及TWCS压缩。该博客文章对其架构进行了全面解析。