标签
本综述探讨了多模态大语言模型中的计算幽默理解,涵盖了方法、数据集、评估协议以及诸如易受捷径影响的评估和证据基础薄弱等挑战。
本立场论文认为,机器学习中的真实标准数据集并非客观真理,而是由选择塑造的人为构建,并主张阐明这些选择以提高可靠性、透明度和问责性。
This project open-sources datasets that can be used for algorithm training and research.
The Well 是一个开源数据集,包含15TB的物理模拟数据,涵盖16个领域,由Flatiron Institute和11所大学共同创建,旨在训练PDE代理模型,使研究人员能够用神经网络替代昂贵的超级计算机模拟。
LeRobot v0.6.0 是 Hugging Face 机器人学习库的一个重要版本,新增世界模型策略(VLA-JEPA、FastWAM、LingBot-VA)、新的 VLAs、奖励模型、六个模拟基准、深度感知、基于 VLM 的数据集注释、自定义视频编码、云端训练,以及用于人工在环校正的部署 CLI。
HuggingFace CEO Clement Delangue 整理了250个来自美国的开放AI里程碑,重点介绍了Transformer、PyTorch、BERT、GPT-2和Llama等贡献,并呼吁在AI开发中保持开放性。
一个用于机器学习和模型训练的网络安全数据集集合,涵盖网络流量、恶意软件、Web攻击、钓鱼等,包括LANL、CTU-13和UNSW-NB15等著名公共研究数据集。
一个精选的GNN论文、数据集和实现工具集合,托管在GitHub上。
Strauss Zelnick 解释说,人工智能受限于向后看的数据,能够复现已知内容但无法创造突破,从而凸显了人类在决定构建什么方面的价值。
本文讨论中国作为后来者如何在AI领域迅速取得进展,质疑数据集、算力和算法的来源,这些使DeepSeek等公司能够赶上OpenAI和Google等美国领先者。
今天,Macrodata Labs 宣布成立,同时推出了 Refiner,一个用于处理机器人数据集的开源框架。该框架旨在帮助团队从演示和传感器数据中提取更多信号。
作者是一名机器学习学生,向机器人社区提出关于数据互操作性的问题,并提议进行一项实验,以规范化和丰富公共机器人数据集,以便更好地重用。
本文介绍了用于可复现的AI驱动热流体研究的开放多模态数据集和开源软件包,提出了时空维度框架及SeqReg等序列回归工具。
一位开发者感谢5000名关注者支持开源临床AI项目OpenMed,并暗示即将发布新的模型和数据集。
HuggingFace 基准数据集现在支持按模型大小筛选,从而可以进行类似 'swebenchverified 上 32B 以下最佳模型' 的比较。
对从零开始训练AI模型的挑战与魅力的个人反思,强调了数据、硬件和扩展方面的困难,同时指出令人惊讶的是,在普通硬件上也能训练出相当不错的小模型。
讨论了AI智能体工作流真实数据集的稀缺性,指出现有基准测试未能捕捉到混乱的生产场景,如工具故障、模糊请求和长时间对话漂移,并寻求更好的数据集推荐。