dataset-release

标签

Cards List
#dataset-release

@freemanjiangg: 我很高兴分享我在 Sesame 上的工作成果!https://turnbench.sesame.com 是我们的轮流发言基准…

X AI KOLs Following · 昨天 缓存

Sesame 发布了 TurnBench,这是一个用于评估实时对话轮流发言的基准测试,包含排行榜和标注数据集,以评估模型在检测语音事件方面的性能。

0 人收藏 0 人点赞
#dataset-release

MTDiag:面向临床意义的多轮诊断数据集,用于评估大语言模型

arXiv cs.CL · 3天前 缓存

本文介绍了MTDiag,一个多轮诊断对话数据集,用于在现实临床诊断场景中评估大语言模型,解决了静态问答基准测试的局限性。

0 人收藏 0 人点赞
#dataset-release

评估经典与Transformer模型在文档敏感性分类中的性能

arXiv cs.LG · 2026-08-19 缓存

本文介绍了Strategic 16K,一个用于文档敏感性分类的泄露控制数据集,并对经典与基于Transformer的模型进行了基准测试,其中BERT在解决标签泄露问题的同时取得了最佳性能。

0 人收藏 0 人点赞
#dataset-release

[大数据集发布] - SupraLabs/reasoning-corpus-4K-5M-v1 - 训练你的小型 SLM 学会思考!

Reddit r/LocalLLaMA · 2026-07-24

SupraLabs 发布了 reasoning-corpus-4K-5M-v1,一个包含 500 万样本的推理数据集,用于训练小型语言模型 (SLM),包含思维链追踪和 ChatML 格式,托管在 Hugging Face 上。

0 人收藏 0 人点赞
#dataset-release

基于日本全国学力·学习情况调查90万规模学生答题分布汇总数据的以人类为基准的多模态基准测试

arXiv cs.CL · 2026-05-13 缓存

研究人员提出了一种源自日本全国学力·学习情况调查的新多模态基准测试,包含90万条汇总的学生答题数据,用于评估多模态大语言模型(MLLM)在真实K-12教育场景下的表现。

0 人收藏 0 人点赞
#dataset-release

Checkup2Action:用于生成面向患者的行动卡片的临床体检报告多模态数据集

arXiv cs.CL · 2026-05-13 缓存

本文介绍了Checkup2Action,这是一个用于从临床体检报告生成面向患者的行动卡片的多模态数据集和基准测试,旨在解决普通患者理解医疗报告的困难。

0 人收藏 0 人点赞
#dataset-release

PianoCoRe:整合与优化的大规模钢琴MIDI数据集

Hugging Face Daily Papers · 2026-05-07 缓存

PianoCoRe是一个大规模钢琴MIDI数据集,对开源音乐语料库进行统一和优化,包含5,625首作品、483位作曲家的250,046个演奏版本,提供音符级乐谱对齐,适用于音乐信息检索任务,并包含一个MIDI质量分类器和对齐优化流程。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈