标签
本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。
该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。
本综述通过引入定义、分类法和任务驱动的建议,形式化了计算病理学中的可解释人工智能(XAI)方法,以应对临床采纳的挑战。
本文提出了一种统一分类体系,用于研究社交媒体上的多语言多模态虚假信息,利用大规模数据集和基于视觉语言模型的自动标注,以揭示检测和缓解的见解。
TutorTrace提供了一个数据集和分类体系,旨在AI辅助编程教育中对学习者行为状态进行分类,借助IDE遥测和行为上下文实现实时可见与可计算的适应性辅导系统。
本文讨论了一篇新论文,该论文主张目前将人类祖先分为人属、南方古猿属和傍人属等属的分类已经过时,需要根据新的化石和遗传证据进行修订。
本综述提出了一个统一的分类体系和框架,用于在 Foundation Models 时代跨视觉、动态和体现层面的以人为本的智能,旨在弥合分散的研究并提供连贯的参考。
这篇来自沃尔玛全球技术的arXiv论文提出了一种上下文感知的多智能体框架,可自动构建大规模零售目录的“Lines and Ladders”定价分类法,在生产环境中取得了优异的F1值和精确率。
本文介绍了因子化假设搜索(Factorized Hypothesis Search, FHS),一种在输入提供间接上下文证据(如表格单元格或临床笔记)时从大型分类法中检索概念的方法。FHS 在金融分类法标注和 CodiEsp 临床编码任务上取得了优异结果,在 Recall@1、MRR 和准确率方面均优于非 oracle 基线方法。
这是一篇综述论文,为具身代理中的语言接地引入了功能角色分类,区分了五种角色,并通过审计证据来评估语言的贡献是否真正得到支持。
本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。
这篇 arXiv 论文提出了一种以交互为中心的分类法,用于将 LLM 智能体故障定位到具体组件(模型 vs 框架 vs 环境),在交互边上组织了 41 种故障模式,使修复具有可操作性。论文使用人类标注和前沿模型评审员验证了该分类法。
本文主张应将大型语言模型中的概念视为一个设计轴心,沿着流水线阶段和基础维度映射设计空间,并提出从事后恢复概念转向设计明确的概念表示。
本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。
本文提出了一种用于NLP中课程学习的细粒度分类法,将难度评估与训练调度分离,从而能够系统性地分析和比较CL策略。它识别了先前工作中存在的不可比问题,并提供了一个设计和评估CL方法的框架。