标签
推文推荐两本机器学习书籍:《管理机器学习项目:从设计到部署》和《机器学习设计模式》,并详细描述了前者的项目管理技巧。
一位软件工程师反思科学家往往缺乏软件工程技能,以优化天体物理学模拟后处理工具为例,倡导为科学家开设一门类似“Missing Semester”的课程。
freeCodeCamp 发布了一本关于 Python 聚类的综合手册,涵盖 K-means、层次聚类和 DBSCAN 聚类,并附有实现和可视化。
Kirk Borne 分享了一本关于使用 Python 进行金融风险管理的机器学习的书,强调机器学习模型如何改进金融建模并适应不断变化的数据模式。
Alexander Rakhlin 被任命为麻省理工学院统计与数据科学中心主任,接替 Ankur Moitra,并将领导跨学科的统计与人工智能研究工作。
A comprehensive guide for software developers entering the data field, explaining the data tools landscape, key concepts, and workflows from ingestion to visualization.
本文介绍了UrbanDS——一个面向数据密集型城市任务的图引导LLM多智能体系统,以及用于评估此类系统的基准UrbanDS-Bench。实验表明,它优于现有的数据科学智能体,并已部署在真实的城市运营平台中。
本文比较了 2026 年数据科学工作流中的 ChatGPT 和 Claude,指出两个模型现在都依赖原生 Python 执行计算。ChatGPT 在原始数据处理和统计建模方面表现出色,而 Claude 在交互式可视化和大上下文整合方面占据主导地位。
Kirk Borne 分享了一本关于数据科学、机器学习和信号处理的线性代数教材的推荐,附有亚马逊链接以及学术界的赞誉。
Perplexity AI 宣布推出 Bumblebee Pipeline,这是一个用于大数据和 AI 工作流的工具,由知名 AI 影响者 gp_pulipaka 分享。
Roman Vershynin 的教材《High-Dimensional Probability》第二版可从作者网站免费下载PDF,面向数据科学的博士生和研究人员。
推广《数学方法在数据科学》一书,该书使用Python连接理论与实践,可在亚马逊购买。
建议推文:只构建两个关键AI/DS项目——一个真实的ML预测应用和一个RAG+agent应用——就能获得高薪职业。
一本全面指南,助你精通 Kaggle 数据科学竞赛,涵盖机器学习、生成式 AI 和大语言模型技术,新增时间序列与生成式 AI 章节。
宣传曼宁出版社的《Python中的异常值检测》一书,涵盖多种异常值检测技术,重点强调可解释性。
推广《数据科学中的图算法》一书,该书教授图算法及其在Neo4j中的应用,涵盖知识图谱、社交网络分析和节点嵌入等主题。
一位统计学家提出了一种工作流程,其中AI用于头脑风暴和演示文稿格式化,而人类专家则负责核心定量分析以保持准确性。
分享了来自加州大学戴维斯分校的 David Cherney、Tom Denton 和 Andrew Walton 编写的《线性代数》免费PDF,强调了该书对人工智能和数据科学的重要性。
由KirkDBorne分享的关于选择正确统计检验的速查表。
关于学习Python的NumPy库的推广推文,链接到官方指南书和numpy.org/learn网站。