datasets

标签

Cards List
#datasets

在发布前制造一个黄金标准评估数据集

Reddit r/AI_Agents · 2026-07-23

一位开发者分享了为没有用户的AI产品创建黄金标准评估数据集的挑战,考虑了合成数据生成和对抗性测试,以避免发布后的重构。

0 人收藏 0 人点赞
#datasets

机器学习何时超越价值排序?基于三个数据集的风险暴露加权发货优先级诊断

arXiv cs.AI · 2026-07-22 缓存

本文通过三个数据集研究机器学习何时在风险暴露加权发货优先级排序中优于传统价值排序。

0 人收藏 0 人点赞
#datasets

多模态大语言模型的计算幽默:方法、数据集、评估与挑战

Hugging Face Daily Papers · 2026-07-21 缓存

本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。

0 人收藏 0 人点赞
#datasets

立场:每一个真实标准都是人为构建的,而非客观真理

arXiv cs.LG · 2026-07-14 缓存

本立场论文认为,机器学习中的真实标准数据集并非客观真理,而是由选择塑造的人为构建,并主张阐明这些选择以提高可靠性、透明度和问责性。

0 人收藏 0 人点赞
#datasets

@seclink: 这个项目有点意思, 它开源了一些可以用来做算法训练和研究的数据集合。

X AI KOLs Timeline · 2026-07-11 缓存

This project open-sources datasets that can be used for algorithm training and research.

0 人收藏 0 人点赞
#datasets

@HowToPrompt__: 有人开源了15TB的物理模拟数据,这些模拟原本需要国家实验室和数百万美元的超级计算机时间才能复现…

X AI KOLs Timeline · 2026-07-10 缓存

The Well 是一个开源数据集,包含15TB的物理模拟数据,涵盖16个领域,由Flatiron Institute和11所大学共同创建,旨在训练PDE代理模型,使研究人员能够用神经网络替代昂贵的超级计算机模拟。

0 人收藏 0 人点赞
#datasets

超越社交媒体的心理健康障碍检测:现有数据集的系统综述

arXiv cs.CL · 2026-07-07 缓存

对非社交媒体自由文本数据集进行系统综述,用于心理健康障碍检测,识别当前资源中的偏见与空白。

0 人收藏 0 人点赞
#datasets

LeRobot v0.6.0: 想象、评估、改进

Hugging Face Blog · 2026-07-07 缓存

LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。

0 人收藏 0 人点赞
#datasets

@ClementDelangue:在美国迎来250周年之际,我们整理了250个来自美国的开放AI里程碑:开放模型、数据集、演示、论文以及工具……

X AI KOLs Following · 2026-07-04 缓存

HuggingFace CEO Clement Delangue 整理了250个来自美国的开放AI里程碑,重点介绍了Transformer、PyTorch、BERT、GPT-2和Llama等贡献,并呼吁在AI开发中保持开放性。

0 人收藏 0 人点赞
#datasets

@0x0SojalSec: 面向机器学习/模型训练的绝佳网络安全数据集,- 网络流量 - 恶意软件 - Web攻击 - 钓鱼…

X AI KOLs Timeline · 2026-07-02 缓存

一个用于机器学习和模型训练的网络安全数据集集合,涵盖网络流量、恶意软件、Web攻击、钓鱼等,包括LANL、CTU-13和UNSW-NB15等著名公共研究数据集。

0 人收藏 0 人点赞
#datasets

@tom_doerr: 精选的GNN论文、数据集和实现工具 https://github.com/dair-ai/GNNs-Recipe…

X AI KOLs Timeline · 2026-06-26 缓存

一个精选的GNN论文、数据集和实现工具集合,托管在GitHub上。

0 人收藏 0 人点赞
#datasets

人工智能数据集本质上是向后看的。而创造力本质上是向前看的。

Reddit r/artificial · 2026-06-18

Strauss Zelnick 解释说,人工智能受限于向后看的数据,能够复现已知内容但无法创造突破,从而凸显了人类在决定构建什么方面的价值。

0 人收藏 0 人点赞
#datasets

美国主导了大部分AI研发,中国近期如何能如此迅速地发展AI?

Reddit r/ArtificialInteligence · 2026-06-14

本文讨论中国作为后来者如何在AI领域迅速取得进展,质疑数据集、算力和算法的来源,这些使DeepSeek等公司能够赶上OpenAI和Google等美国领先者。

0 人收藏 0 人点赞
#datasets

@gui_penedo:今天我们宣布成立 Macrodata Labs。过去几年,@HKydlicek 和我一直在将互联网的很大一部分转化为……

X AI KOLs Following · 2026-06-11 缓存

今天,Macrodata Labs 宣布成立,同时推出了 Refiner,一个用于处理机器人数据集的开源框架。该框架旨在帮助团队从演示和传感器数据中提取更多信号。

0 人收藏 0 人点赞
#datasets

在我们花数月处理开源机器人数据集之前,请告诉我们为什么这是个坏主意 [D]

Reddit r/MachineLearning · 2026-05-30

作者是一名机器学习学生,向机器人社区提出关于数据互操作性的问题,并提议进行一项实验,以规范化和丰富公共机器人数据集,以便更好地重用。

0 人收藏 0 人点赞
#datasets

用于多相输运和热系统数据驱动建模的开放多模态数据集与开源软件

arXiv cs.LG · 2026-05-25 缓存

本文介绍了用于可复现的AI驱动热流体研究的开放多模态数据集和开源软件包,提出了时空维度框架及SeqReg等序列回归工具。

0 人收藏 0 人点赞
#datasets

@MaziyarPanahi:开源临床AI是一个小众领域,大多数时候感觉就像对着一个PubMed形状的虚空呐喊。然而,你们中的5000人……

X AI KOLs Following · 2026-05-22 缓存

一位开发者感谢5000名关注者支持开源临床AI项目OpenMed,并暗示即将发布新的模型和数据集。

0 人收藏 0 人点赞
#datasets

HuggingFace 基准数据集现在支持按模型大小筛选

Reddit r/LocalLLaMA · 2026-05-20

HuggingFace 基准数据集现在支持按模型大小筛选,从而可以进行类似 'swebenchverified 上 32B 以下最佳模型' 的比较。

0 人收藏 0 人点赞
#datasets

如果我真的很想从零开始训练一个AI会怎样?

Reddit r/artificial · 2026-05-19

对从零开始训练AI模型的挑战与魅力的个人反思,强调了数据、硬件和扩展方面的困难,同时指出令人惊讶的是,在普通硬件上也能训练出相当不错的小模型。

0 人收藏 0 人点赞
#datasets

为什么针对智能体工作流的真实数据集仍然难以找到?

Reddit r/AI_Agents · 2026-05-15

讨论了AI智能体工作流真实数据集的稀缺性,指出现有基准测试未能捕捉到混乱的生产场景,如工具故障、模糊请求和长时间对话漂移,并寻求更好的数据集推荐。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈