标签
这条推文推广了Ren和Wang所著的《Mathematical Methods in Data Science》一书,该书涵盖了微分方程等数据科学应用的数学方法,适合高阶学生。
在投资者需求高达150亿美元后,Databricks以1900亿美元估值融资50亿美元,尽管最初只寻求10亿美元。CEO Ali Ghodsi表示,70亿美元的年化收入增长80%以及高昂的AI投资成本是此次融资的原因。
一位开发者展示,Apache DataFusion 可以通过将数据卸载到磁盘,在配备5–10GB内存的笔记本电脑上执行 PageRank 和弱连通分量等十亿级图分析,从而挑战对 Spark/GraphFrames 的需求。
Perplexity AI 宣布推出 Bumblebee Pipeline,这是一个用于大数据和 AI 工作流的工具,由知名 AI 影响者 gp_pulipaka 分享。
Databricks Delta Sharing 是一个开放协议,能够实现跨云提供商的安全、实时数据共享,无需复制,减少出站成本并简化多云数据访问。
提出Big-means++,一种简单的算法,通过系统性地整理输入并使用样本诱导的代理景观,实现大数据K-means聚类的全局优化质量。
多模态宇宙(MMU)是一个80TB以上的天文巡天数据集,已被转换为HATS parquet格式,使得可以通过LSDB和Hugging Face生态系统在笔记本电脑上进行交叉匹配,无需批量下载。
GitHub 上有一个精心收集的数据工程师面试题库 data-engineering-interview-questions,收录了超过 2000 道题,覆盖数据库、大数据框架、云平台、数据可视化等核心方向。
Vera C. Rubin天文台已开始初步观测,已经发现了快速旋转的小行星、超新星以及一个潜在的星际访客,预示着大数据天文学新时代的到来。
本文介绍了一种基于知识的方法,利用知识图谱嵌入,通过预测上下文表示与质量规则之间的缺失边来自动评估大数据质量,优于传统的匹配方法。