dataset

标签

Cards List
#dataset

TutorMoments:AI导师知道何时该帮助、何时该收手吗?

Hugging Face Blog · 昨天 缓存

Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。

0 人收藏 0 人点赞
#dataset

衡量与检测有害的AI谄媚行为

arXiv cs.AI · 2天前 缓存

本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。

0 人收藏 0 人点赞
#dataset

@vanstriendaniel:已将包含1,080,814张公有领域图片的数据集上传到Hub,这些图片主要来自19世纪的书籍。https://huggingface.c…

X AI KOLs Following · 3天前 缓存

Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。

0 人收藏 0 人点赞
#dataset

IslamicTurathBench:评估大语言模型在伊斯兰学术传统(turath)上的多任务、多学科基准

arXiv cs.CL · 3天前 缓存

IslamicTurathBench(ISTB)是一个新的多任务、多学科基准,用于评估大语言模型在古典伊斯兰学术上的表现,包含 3,465 道专家审核的题目,涵盖 35 部著作和七个领域。

0 人收藏 0 人点赞
#dataset

MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc

arXiv cs.AI · 4天前 缓存

This paper presents MMLongBench-Doc-V2, a corrected and semantics-aware revision of the MMLongBench-Doc long-document QA benchmark, fixing annotation errors and replacing string matching with an LLM judge, along with a decision procedure for empty-set keys.

0 人收藏 0 人点赞
#dataset

构建用于检测俄语社交媒体文本中自杀前兆和反自杀信号的大规模数据集的方法学

arXiv cs.CL · 5天前 缓存

本文提出了一种从社交媒体文本构建大规模俄语数据集的方法,用于检测自杀前兆和反自杀信号,包括标注指南和基线分类实验。

0 人收藏 0 人点赞
#dataset

LegalPincite:多层级法律信息检索数据集

Hugging Face Daily Papers · 5天前 缓存

介绍LegalPincite,一个基于欧盟法院(CJEU)判决构建的大规模法律信息检索数据集,包含掩码查询、完整语料库和段落级引文标注,以支持多层级检索评估。

0 人收藏 0 人点赞
#dataset

ARB:用于AI文本检测器评估的匹配作者重写基准数据集

arXiv cs.CL · 6天前 缓存

介绍ARB,一个用于评估AI文本检测器的匹配作者重写基准,表明尽管对直接LLM生成的文本具有高召回率,但当人类文本被LLM重写时,检测器性能显著下降。

0 人收藏 0 人点赞
#dataset

Ego2Robot:从第一人称人类数据规模化合成机器人数据

Hugging Face Daily Papers · 6天前 缓存

Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。

0 人收藏 0 人点赞
#dataset

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Hugging Face Daily Papers · 6天前 缓存

介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。

0 人收藏 0 人点赞
#dataset

FactorJEPA:将整体式未来分解为布局-智能体-交互通道,用于拥挤混乱的全球南方城市世界

Hugging Face Daily Papers · 2026-08-02 缓存

介绍了DENSEWORLD,一个包含1000小时拥挤的全球南方城市场景的数据集,以及FactorJEPA,一种将未来预测分解为布局、智能体和交互的JEPA变体,在遮挡和异质性条件下提高了准确性和鲁棒性。

0 人收藏 0 人点赞
#dataset

解码儿童步态行为

Hugging Face Daily Papers · 2026-08-01 缓存

介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。

0 人收藏 0 人点赞
#dataset

ICLE++:面向整体作文评分的细粒度特征建模

arXiv cs.CL · 2026-07-31 缓存

本文介绍了ICLE++,一个包含整体评分和特征评分的说服性学生作文新语料库,旨在提升自动化作文评分(AES)研究中的泛化能力和多特征评分能力。

0 人收藏 0 人点赞
#dataset

AHA-Memes:用于理解阿拉伯语迷因中仇恨的细粒度多模态基准

arXiv cs.CL · 2026-07-31 缓存

本文介绍了 AHA-Memes,这是首个具有细粒度多标签注释的大规模阿拉伯语仇恨迷因基准,包含 5K 条人工注释和约 66K 条银标签迷因,并评测了多种多模态模型在基于文化的仇恨检测中的表现。

0 人收藏 0 人点赞
#dataset

CG-World:面向世界模型的大规模世界状态数据集与协议

arXiv cs.AI · 2026-07-31 缓存

CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。

0 人收藏 0 人点赞
#dataset

制作用于微调的合成数据集

Reddit r/LocalLLaMA · 2026-07-30

作者提出了一种使用形式求解器为LLM生成多样化合成推理训练数据的流程,并询问现有工作以及关于避免重复模板的建议。

0 人收藏 0 人点赞
#dataset

来自美国网络流媒体录音的宗教电台广播转录文本的大规模语料库

arXiv cs.CL · 2026-07-30 缓存

本数据描述文档介绍了一个大规模语料库,包含从2025年7月为期一个月的实时网络流中捕获的宗教广播转录文本,共计超过70万条录音和6000万行转录文本,并使用大语言模型对节目格式和主题进行了标注。该语料库支持对宗教广播的描述性研究,以及宗教媒体中社会/政治议题的分析。

0 人收藏 0 人点赞
#dataset

ACE-Data-0:以人为中心的环境采集作为具身数据引擎

Hugging Face Daily Papers · 2026-07-30 缓存

介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。

0 人收藏 0 人点赞
#dataset

Indic DiarBench:面向印度语言的多语言联合说话人日志与自动语音识别基准

arXiv cs.CL · 2026-07-28 缓存

Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。

0 人收藏 0 人点赞
#dataset

GEMCo:一种经过验证的、可伦理发布的代理,用于替代不可获取的咨询数据

arXiv cs.CL · 2026-07-28 缓存

本文介绍了GEMCo,这是首个公开可用的德语多轮电子邮件咨询对话语料库,经过真实咨询数据验证,可作为不可获取敏感数据的可伦理发布代理。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈