taxonomy

标签

Cards List
#taxonomy

HalluPeer:一个基于分类体系的科学同行评审幻觉检测基准测试

arXiv cs.AI · 5天前 缓存

本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。

0 人收藏 0 人点赞
#taxonomy

交互式生命之树

Hacker News Top · 5天前 缓存

Ptree 是一个交互式网络工具,用于可视化生命之树中的生态互动,涵盖诸如摄食、寄生和共生等类别。

0 人收藏 0 人点赞
#taxonomy

审计自改进智能体中的框架篡改

arXiv cs.CL · 2026-09-02 缓存

该论文提出了一种针对自改进AI智能体中框架篡改的双轴分类法,构建了一个标注语料库以基准测试审计方法,并发现篡改在真实智能体轨迹中发生,强调了完整性风险。

0 人收藏 0 人点赞
#taxonomy

授权术语混乱:我们来解决它

Hacker News Top · 2026-09-01 缓存

文章认为授权术语令人混乱,并提出基于五个关键问题的分类法,以更好地对RBAC、ABAC和PBAC等模型进行分类。

0 人收藏 0 人点赞
#taxonomy

计算病理学中的可解释人工智能(XAI):定义、分类法和建议

arXiv cs.AI · 2026-09-01 缓存

本综述通过引入定义、分类法和任务驱动的建议,形式化了计算病理学中的可解释人工智能(XAI)方法,以应对临床采纳的挑战。

0 人收藏 0 人点赞
#taxonomy

MMMMM:用于研究多语言多模态虚假信息机制的统一分类体系

Hugging Face Daily Papers · 2026-08-30 缓存

本文提出了一种统一分类体系,用于研究社交媒体上的多语言多模态虚假信息,利用大规模数据集和基于视觉语言模型的自动标注,以揭示检测和缓解的见解。

0 人收藏 0 人点赞
#taxonomy

TutorTrace:一个用于在AI辅助编程教育中分类学习者行为状态的数据集与分类体系

arXiv cs.AI · 2026-08-28 缓存

TutorTrace提供了一个数据集和分类体系,旨在AI辅助编程教育中对学习者行为状态进行分类,借助IDE遥测和行为上下文实现实时可见与可计算的适应性辅导系统。

0 人收藏 0 人点赞
#taxonomy

为何或许是时候重新思考人类进化树了

Hacker News Top · 2026-08-20 缓存

本文讨论了一篇新论文,该论文主张目前将人类祖先分为人属、南方古猿属和傍人属等属的分类已经过时,需要根据新的化石和遗传证据进行修订。

0 人收藏 0 人点赞
#taxonomy

以人为本的智能在 Foundation Models 时代:综述

Hugging Face Daily Papers · 2026-08-18 缓存

本综述提出了一个统一的分类体系和框架,用于在 Foundation Models 时代跨视觉、动态和体现层面的以人为本的智能,旨在弥合分散的研究并提供连贯的参考。

0 人收藏 0 人点赞
#taxonomy

揭秘代理技能:为何有效——直至失效

arXiv cs.AI · 2026-08-17 缓存

本文研究了技能增强LLM代理性能的条件,通过受控实验分析成功与失败因素,并提出了技能使用模式的分类法。

0 人收藏 0 人点赞
#taxonomy

跨学科分类与建模:误解的生成、放大与检测,从语用学到AI代理

arXiv cs.AI · 2026-08-17 缓存

本文提出了一个跨学科分类和建模框架,用于理解、放大和检测误解,连接了语用学和AI代理系统。

0 人收藏 0 人点赞
#taxonomy

Lines and Ladders:一种面向大规模零售价格分类法的上下文感知多智能体框架

arXiv cs.AI · 2026-08-14 缓存

这篇来自沃尔玛全球技术的arXiv论文提出了一种上下文感知的多智能体框架,可自动构建大规模零售目录的“Lines and Ladders”定价分类法,在生产环境中取得了优异的F1值和精确率。

0 人收藏 0 人点赞
#taxonomy

构建视角的空间结构

arXiv cs.CL · 2026-08-13 缓存

本文回顾了NLP中“视角”的概念,提出了沿特定性轴排列的视角相关概念层级,并展示了该层级如何帮助研究者选择恰当的操作化定义。

0 人收藏 0 人点赞
#taxonomy

面向证据到分类法检索的因子化假设搜索

arXiv cs.CL · 2026-08-10 缓存

本文介绍了因子化假设搜索(Factorized Hypothesis Search, FHS),一种在输入提供间接上下文证据(如表格单元格或临床笔记)时从大型分类法中检索概念的方法。FHS 在金融分类法标注和 CodiEsp 临床编码任务上取得了优异结果,在 Recall@1、MRR 和准确率方面均优于非 oracle 基线方法。

0 人收藏 0 人点赞
#taxonomy

语言的作用与证据支持:具身代理中语言接地的功能角色分类及证据审计

arXiv cs.CL · 2026-08-05 缓存

这是一篇综述论文,为具身代理中的语言接地引入了功能角色分类,区分了五种角色,并通过审计证据来评估语言的贡献是否真正得到支持。

0 人收藏 0 人点赞
#taxonomy

评估盲区:静默测量失败如何从训练到部署破坏AI系统

arXiv cs.LG · 2026-08-05 缓存

本文介绍了“评估盲区”(evaluation blindness),这是一个用于描述从训练到部署过程中破坏AI系统的静默测量失败的正式框架,包含案例研究、基于50个真实事件验证的失败分类法,以及失败预算框架。

0 人收藏 0 人点赞
#taxonomy

模型还是框架?以交互为中心的智能体故障定位分类法

arXiv cs.AI · 2026-08-03 缓存

这篇 arXiv 论文提出了一种以交互为中心的分类法,用于将 LLM 智能体故障定位到具体组件(模型 vs 框架 vs 环境),在交互边上组织了 41 种故障模式,使修复具有可操作性。论文使用人类标注和前沿模型评审员验证了该分类法。

0 人收藏 0 人点赞
#taxonomy

从发现到设计:概念作为大型语言模型的设计轴心

arXiv cs.CL · 2026-07-30 缓存

本文主张应将大型语言模型中的概念视为一个设计轴心,沿着流水线阶段和基础维度映射设计空间,并提出从事后恢复概念转向设计明确的概念表示。

0 人收藏 0 人点赞
#taxonomy

从孤立任务到结构化能力:大型语言模型的多层分类法

arXiv cs.CL · 2026-07-27 缓存

本文提出了一种面向大型语言模型的多层分类法,包含14个能力域和91个子技能,借鉴人类认知科学来组织超越孤立任务的LLM评估。通过映射主要AI会议上的15,934篇论文,展示了其实用性,揭示了语言语义能力和推理的集中关注,同时识别出探索不足的领域。

0 人收藏 0 人点赞
#taxonomy

解构NLP中的课程学习:迈向统一分类法

arXiv cs.CL · 2026-07-22 缓存

本文提出了一种用于NLP中课程学习的细粒度分类法,将难度评估与训练调度分离,从而能够系统性地分析和比较CL策略。它识别了先前工作中存在的不可比问题,并提供了一个设计和评估CL方法的框架。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈