标签
Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。
本文介绍了对比锚点探测(CAP)框架,用于研究和检测大语言模型(LLM)中由偏好引发的立场反转谄媚(PSRS),分析了17个模型中的290,460条标注响应,并表明仅凭响应文本即可实现检测。
Daniel van Strien将来自大英图书馆49,455本数字化图书(约1510–1900年)的1,080,814张公有领域图片上传至Hugging Face Hub,并按图片类型分为四个配置。
IslamicTurathBench(ISTB)是一个新的多任务、多学科基准,用于评估大语言模型在古典伊斯兰学术上的表现,包含 3,465 道专家审核的题目,涵盖 35 部著作和七个领域。
This paper presents MMLongBench-Doc-V2, a corrected and semantics-aware revision of the MMLongBench-Doc long-document QA benchmark, fixing annotation errors and replacing string matching with an LLM judge, along with a decision procedure for empty-set keys.
本文提出了一种从社交媒体文本构建大规模俄语数据集的方法,用于检测自杀前兆和反自杀信号,包括标注指南和基线分类实验。
介绍LegalPincite,一个基于欧盟法院(CJEU)判决构建的大规模法律信息检索数据集,包含掩码查询、完整语料库和段落级引文标注,以支持多层级检索评估。
介绍ARB,一个用于评估AI文本检测器的匹配作者重写基准,表明尽管对直接LLM生成的文本具有高召回率,但当人类文本被LLM重写时,检测器性能显著下降。
Ego2Robot是一个可扩展的流水线,通过动作重定向和视觉合成,将第一人称人类操作视频转换为机器人训练数据,生成涵盖15种机器人形态的18,561小时数据。实验表明,在该合成数据与真实机器人数据上联合预训练,可提升视觉-语言-动作模型在分布外场景下的泛化能力,并已在真实机器人部署中得到验证。
介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。
介绍了DENSEWORLD,一个包含1000小时拥挤的全球南方城市场景的数据集,以及FactorJEPA,一种将未来预测分解为布局、智能体和交互的JEPA变体,在遮挡和异质性条件下提高了准确性和鲁棒性。
介绍了一个新的问题领域,用于从标准RGB视频中对儿童步态行为进行细粒度分析,同时提供了一个包含超过1,100个高帧率序列的新数据集和一个统一框架,证明了当前的SOTA方法和多模态大语言模型(MLLMs)在此临床任务上表现不佳。
本文介绍了ICLE++,一个包含整体评分和特征评分的说服性学生作文新语料库,旨在提升自动化作文评分(AES)研究中的泛化能力和多特征评分能力。
本文介绍了 AHA-Memes,这是首个具有细粒度多标签注释的大规模阿拉伯语仇恨迷因基准,包含 5K 条人工注释和约 66K 条银标签迷因,并评测了多种多模态模型在基于文化的仇恨检测中的表现。
CG-World 是一个从工业计算机图形学流水线中衍生的大规模世界状态数据集与协议,明确记录了多模态世界状态、干预和反事实分支,以支持世界模型研究。它展示了在几何条件视频生成、动作预测以及视觉-语言-动作策略的闭环迁移方面的改进。
本数据描述文档介绍了一个大规模语料库,包含从2025年7月为期一个月的实时网络流中捕获的宗教广播转录文本,共计超过70万条录音和6000万行转录文本,并使用大语言模型对节目格式和主题进行了标注。该语料库支持对宗教广播的描述性研究,以及宗教媒体中社会/政治议题的分析。
介绍了ACE-Data-0,这是一个大规模具身AI数据集,包含150小时、跨200个任务类别的同步多模态人类演示,由环境采集引擎(ACE)在真实家庭环境中捕捉。数据集附带一个分层基准,揭示了现有方法在接触、遮挡和长时程任务下的明显不足。
Indic DiarBench 是一个多语言联合说话人日志与自动语音识别基准,覆盖印度全部22种官方语言,包含108小时人工校正的多说话人音频,捕捉了语码混合、说话人重叠等对话细节。
本文介绍了GEMCo,这是首个公开可用的德语多轮电子邮件咨询对话语料库,经过真实咨询数据验证,可作为不可获取敏感数据的可伦理发布代理。