标签
关于学习Python的NumPy库的推广推文,链接到官方指南书和numpy.org/learn网站。
DSWorld 提出了一种数据科学世界模型,通过预测环境状态转换来减少自主代理中代价高昂的试错过程,在强化学习训练中实现了14倍加速,推理时加速3-6倍,同时保持了有竞争力的性能。
这是一份为不熟悉数据工具的软件开发人员提供的全面指南,涵盖数据生命周期、数据职业和工具生态,并融合了作者在 Deepnote 和 Metabase 的经验见解。
解释传统RAG与Agentic RAG的区别,强调Agentic RAG增加了决策层以实现迭代检索和多源推理,并提到即将举办的训练营。
一个 GitHub 仓库,提供全面模块化的路线图以及免费资源,涵盖从零开始学习 AI、ML、深度学习及相关领域所需的知识,包括数学基础、数据科学和生成式 AI。
推广一个名为“AI Expert Roadmap”的存储库,该库为人工智能、机器学习、深度学习、数据工程、大数据和数据科学提供了结构化的学习路径。
精心整理的880个优秀Python机器学习开源项目合集,覆盖自然语言处理、数据可视化和时间序列等多个领域。
介绍CausalDS,一个用于评估基于LLM的数据科学智能体中因果推理的基准。它利用合成结构因果模型和自然语言故事测试关联、干预和反事实推理,以及工具使用和弃权。
本文研究了LLM生成的可复用技能文件是否能在数据科学工作流中提升AI数据科学家的表现。通过涉及超过9000次运行的广泛消融实验,作者发现生成的技能相较于基线提示并未带来显著改进,因此提醒不要默认使用它们。
本文解释了健康研究中的风险比,为什么不能在不考虑风险随时间分布的情况下直接将其转换为预期寿命变化,并阐明了风险比与相对风险之间的区别。
一条推文讨论了许多数据科学家如何误用Claude Code,并推广了一个受Andrej Karpathy观察启发而创建的CLAUDE.md文件,以改善AI编码行为。
推荐一本开源免费的电子书《Applied Machine Learning in Python》,它结合数学推导和Python实现,覆盖30+算法,并提供交互式可视化,适合系统学习机器学习原理和实战。
一位开发者在GitHub上免费发布了他的机器学习面试准备指南,基于他从Google、LinkedIn、Snap、Coupang和StitchFix收到的真实问题,涵盖学习计划、编程、统计、系统设计等;该仓库现已获得12.4k星标。
介绍了AgenticDataBench,这是一个综合性基准测试,用于评估基于大语言模型的数据代理在不同领域中的表现,提供细粒度、基于技能的指标,包括实际B2B用例和合成任务。
A curated list of 10 free, open-source tools developed by universities and research institutions that rival expensive commercial software, covering reference management, databases, big data, scientific computing, machine learning, document preparation, online learning platforms, and statistical analysis.