data-science

标签

Cards List
#data-science

@ClementDelangue: 非常高兴地发布SmolDataEnvs:5,000个用于代码和数据科学中优化小型模型的可验证RL环境任务…

X AI KOLs Timeline ↗ · 昨天 缓存

SmolDataEnvs现已发布,这是一套包含5000个可验证RL环境任务的集合,专注于代码和数据科学领域的小型模型训练,完全开源。

0 人收藏 0 人点赞
#data-science

使用 Haskell 编写 Parquet 文件

Hacker News Top ↗ · 4天前 缓存

本文详细介绍了如何在 Haskell 中为 DataHaskell/Dataframe 库实现 Parquet 文件写入器,以实现高效的数据序列化并与数据科学生态系统互操作。

0 人收藏 0 人点赞
#data-science

RIP传统数据科学家 角色正在分化:1. ML建模师(年薪6.5万美元)2. AI/DS系统构建者(年薪20万美元) 想要…

X AI KOLs Timeline ↗ · 2026-09-18 缓存

这篇文章推广了一个免费的关于用Python构建AI的实时工作坊,为数据科学家提供了转型为AI/DS系统构建者角色的路线图,并包含实际演示。

0 人收藏 0 人点赞
#data-science

MaximeRivest: 这基本上就是我在他们实现之前,自己在家摸索如何实现jev的历程。

X AI KOLs Following ↗ · 2026-09-17 缓存

作者分享了过去为了在大规模场景下实现高质量的令牌级分类,而探索高效单专家加载方法的经历,呼应了Maxime Rivest关于特定领域专家模型实用性的观点。

0 人收藏 0 人点赞
#data-science

Khipu(Quipu)指南

Hacker News Top ↗ · 2026-09-16 缓存

Khipu指南是一个基于网络的资源,提供对超过600个印加khipus的详细符号渲染和交互式分析,旨在通过计算方法和数据科学使khipu研究民主化。

0 人收藏 0 人点赞
#data-science

@FrankRHutter: 数据科学革命持续进行。TabPFN-3.5 已上线,声称在原始 IID 小数据设置之外达到 SOTA,并且……

X AI KOLs Timeline ↗ · 2026-09-15 缓存

TabPFN-3.5 发布,声称在 IID 小数据设置之外为表格数据提供最先进的性能,具有处理分组和时序数据、不确定性校准以及更快推理等功能。

0 人收藏 0 人点赞
#data-science

@MIT_CSAIL: 统计学初学者指南: https://tinyurl.com/y258cupb v/@OACerebro

X AI KOLs Timeline ↗ · 2026-09-12 缓存

MIT CSAIL分享了一份面向初学者的统计学指南,为数据科学和人工智能提供基础教育内容。

0 人收藏 0 人点赞
#data-science

如果软件工程主要被前沿模型取代,为什么其岗位数量相比数据科学岗位依然如此之多?

Reddit r/singularity ↗ · 2026-09-12

本文质疑,尽管人工智能取得进步,但美国和欧盟的劳动统计及ICT专业人员增长预测显示,软件工程岗位数量为何仍远超数据科学岗位。

0 人收藏 0 人点赞
#data-science

Calendar-SPCA:多周期电力消耗曲线的可解释表征学习

arXiv cs.LG ↗ · 2026-09-10 缓存

本文介绍了Calendar-SPCA,一种用于多周期电力消耗曲线的可解释表征学习的日历结构稀疏主成分方法,展示了在增加稀疏性和一致性的同时保持高解释方差。

0 人收藏 0 人点赞
#data-science

@VirtualElena:运行SOTA LLM分析十年午餐数据的一些收获: - 注意到匿名X用户 @litcapital 有记录中第四昂贵的餐点…

X AI KOLs Following ↗ · 2026-09-08 缓存

一位用户分享了使用最先进的LLM分析十年午餐数据的见解,突出了关于开支和常见餐厅的有趣发现。

0 人收藏 0 人点赞
#data-science

语言模型在统计问题表述上的基准测试

arXiv cs.AI ↗ · 2026-09-03 缓存

本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。

0 人收藏 0 人点赞
#data-science

DS-Lighting: 显式化代理工具链以赋能数据科学自动化

arXiv cs.AI ↗ · 2026-09-01 缓存

DS-Lighting是一个统一的工具链套件,它使工具链设计在数据科学自动化中变得显式,从而提高端到端工作流的可重复性、可比性和可靠性。

0 人收藏 0 人点赞
#data-science

评估荣誉候选人的数据科学方法

arXiv cs.CL ↗ · 2026-08-28 缓存

本文首次应用数据科学,利用自然语言处理技术评估英国荣誉系统,并引入一种新型情感分析算法Minos,以评估公众对荣誉获得者的意见。

0 人收藏 0 人点赞
#data-science

美国超过半数成年人表示缺乏基本统计理解

Hacker News Top ↗ · 2026-08-26 缓存

一项由宾夕法尼亚州立大学主导、发表于《PLOS One》的研究发现,超过一半的美国成年人表示缺乏基本的统计知识,然而大多数人表示如果更好地理解统计,会更多地依赖统计。

0 人收藏 0 人点赞
#data-science

网络欺诈预防的新印记

MIT Technology Review ↗ · 2026-08-25 缓存

MaxMind的首席产品官Rupert Young讨论了他在网络安全和数据科学领域的职业生涯,强调了公司的GeoIP工具在流媒体、安全和商家行业中用于欺诈预防。

0 人收藏 0 人点赞
#data-science

@XAMTO_AI: 做数据分析这几年,最磨人的从来不是写代码,是找数据。东翻西找大半天,最后发现要么不对外开放,要么格式乱七八糟直接劝退。 昨天刷 GitHub 刷到一个叫 Awesome Public Datasets 的清单,好家伙,78k+ Star,…

X AI KOLs Timeline ↗ · 2026-08-21 缓存

介绍了一个GitHub上名为Awesome Public Datasets的清单,收录了全球高质量公开数据集,帮助数据分析师节省寻找数据的时间。

0 人收藏 0 人点赞
#data-science

苏联的优化实践(2016)

Hacker News Top ↗ · 2026-08-20 缓存

本文探讨了苏联经济规划与现代数据科学实践之间的相似之处,重点关注资源分配和基于历史书籍的简化假设等问题。

0 人收藏 0 人点赞
#data-science

我将 Pokelike.xyz 转变为一个用于大语言模型和强化学习的基准测试环境!

Reddit r/LocalLLaMA ↗ · 2026-08-19

一位数据科学家通过将 Pokelike.xyz 转变为一个游戏环境,创建了用于强化学习和大语言模型的基准测试。在这个环境中,AI 机器人可以被训练和测试。该项目是开源的,并邀请贡献以改进机器人的性能。

0 人收藏 0 人点赞
#data-science

澳大利亚主动道路安全干预:基于联网车辆数据预测危险驾驶热点

arXiv cs.LG ↗ · 2026-08-19 缓存

本研究利用来自悉尼的联网车辆遥测数据预测高风险驾驶热点,评估机器学习和时间序列模型在主动道路安全干预中的表现。

0 人收藏 0 人点赞
#data-science

@KirkDBorne:Introduction to Modern Statistics:https://openintro-ims.netlify.app 选择:免费在线阅读。或自定义价格……

X AI KOLs Timeline ↗ · 2026-08-18 缓存

这条推文宣布了《Introduction to Modern Statistics》的第二版,这是一本开源教科书,可以免费在线阅读或以自定义价格获取PDF。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈