标签
SmolDataEnvs现已发布,这是一套包含5000个可验证RL环境任务的集合,专注于代码和数据科学领域的小型模型训练,完全开源。
本文详细介绍了如何在 Haskell 中为 DataHaskell/Dataframe 库实现 Parquet 文件写入器,以实现高效的数据序列化并与数据科学生态系统互操作。
这篇文章推广了一个免费的关于用Python构建AI的实时工作坊,为数据科学家提供了转型为AI/DS系统构建者角色的路线图,并包含实际演示。
作者分享了过去为了在大规模场景下实现高质量的令牌级分类,而探索高效单专家加载方法的经历,呼应了Maxime Rivest关于特定领域专家模型实用性的观点。
Khipu指南是一个基于网络的资源,提供对超过600个印加khipus的详细符号渲染和交互式分析,旨在通过计算方法和数据科学使khipu研究民主化。
TabPFN-3.5 发布,声称在 IID 小数据设置之外为表格数据提供最先进的性能,具有处理分组和时序数据、不确定性校准以及更快推理等功能。
MIT CSAIL分享了一份面向初学者的统计学指南,为数据科学和人工智能提供基础教育内容。
本文质疑,尽管人工智能取得进步,但美国和欧盟的劳动统计及ICT专业人员增长预测显示,软件工程岗位数量为何仍远超数据科学岗位。
本文介绍了Calendar-SPCA,一种用于多周期电力消耗曲线的可解释表征学习的日历结构稀疏主成分方法,展示了在增加稀疏性和一致性的同时保持高解释方差。
一位用户分享了使用最先进的LLM分析十年午餐数据的见解,突出了关于开支和常见餐厅的有趣发现。
本文介绍了StatFormBench,这是一个用于评估LLMs在统计问题表述上的基准测试,发现当前模型在分类问题和识别变量方面存在显著局限性。
DS-Lighting是一个统一的工具链套件,它使工具链设计在数据科学自动化中变得显式,从而提高端到端工作流的可重复性、可比性和可靠性。
本文首次应用数据科学,利用自然语言处理技术评估英国荣誉系统,并引入一种新型情感分析算法Minos,以评估公众对荣誉获得者的意见。
一项由宾夕法尼亚州立大学主导、发表于《PLOS One》的研究发现,超过一半的美国成年人表示缺乏基本的统计知识,然而大多数人表示如果更好地理解统计,会更多地依赖统计。
MaxMind的首席产品官Rupert Young讨论了他在网络安全和数据科学领域的职业生涯,强调了公司的GeoIP工具在流媒体、安全和商家行业中用于欺诈预防。
介绍了一个GitHub上名为Awesome Public Datasets的清单,收录了全球高质量公开数据集,帮助数据分析师节省寻找数据的时间。
一位数据科学家通过将 Pokelike.xyz 转变为一个游戏环境,创建了用于强化学习和大语言模型的基准测试。在这个环境中,AI 机器人可以被训练和测试。该项目是开源的,并邀请贡献以改进机器人的性能。
本研究利用来自悉尼的联网车辆遥测数据预测高风险驾驶热点,评估机器学习和时间序列模型在主动道路安全干预中的表现。
这条推文宣布了《Introduction to Modern Statistics》的第二版,这是一本开源教科书,可以免费在线阅读或以自定义价格获取PDF。