KWBench:衡量知识工作中无提示的问题识别能力
摘要
# 论文页面 - KWBench:衡量知识工作中无提示的问题识别能力 来源:[https://huggingface.co/papers/2604.15760](https://huggingface.co/papers/2604.15760) ## 摘要 KWBench 提供了一个基准,用于评估大模型在无提示情况下识别专业场景的能力,重点考察其能否从原始输入中识别出潜在的博弈论结构。我们发布了 KWBench(Knowledge Work Bench)的首个版本,一个针对无提示问题识别的基准。
查看缓存全文
缓存时间: 2026/04/22 01:58
论文页面 - KWBench:衡量知识工作中无提示的问题识别能力
来源:https://huggingface.co/papers/2604.15760
摘要
KWBench 提出了一项基准,用于评估大语言模型在无提示情况下识别专业场景的能力,重点考察其能否从原始输入中识别出潜在的博弈论结构。
我们发布 KWBench(Knowledge Work Bench)的首个版本,用于评测大语言模型的无提示问题识别能力(https://huggingface.co/papers?q=problem%20recognition):模型能否在动手解决之前就识别出专业场景。现有前沿基准已趋饱和,且目前针对知识工作的评测大多沦为“按规范抽取或完成任务”。KWBench 瞄准的是更早一步:仅凭原始输入就识别出情境的支配结构。
基准包含 223 个任务,来源涵盖并购、合同谈判、临床药学、组织政治、欺诈分析与激励机制设计。每个任务都编码了一种形式化的博弈论模式(委托-代理冲突、信号传递、机制设计失效、策略性隐瞒、联盟动态、策略互依),并附带结构化真值:专家对该情境的解读及预期失败路径。
模型仅收到原始数据与任务提示,无任何题型提示。评分采用三档细则,并设强制合取检查:强制项即预测的错误路径。我们评估了 16 个模型,最佳模型通过 27.9% 的任务;前两名模型在“通过”任务上仅 31.7% 重叠。在前八名模型中,有 44 个任务仅被单一模型解决;对前八名进行路由可覆盖 50.7% 的基准,接近最佳单模型的两倍。
条件于“通过”时,各模型质量得分趋同(≈83%);非条件得分则差异显著。同一模型在被问及时能正确阐述相关博弈论概念,却在无提示应用时失败。我们开源 KWBench,旨在改变前沿模型在知识工作领域的评测方式:不仅看“给定问题后执行得如何”,更看“仅凭情境能否先认出对的问题”。
查看 arXiv 页面(https://arxiv.org/abs/2604.15760)
查看 PDF(https://arxiv.org/pdf/2604.15760)
项目主页(https://kwbench.github.io/)
GitHub0(https://github.com/ankitmaloo/fasteval)
添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2604.15760)
在智能体中获取该论文:
hf papers read 2604.15760
还没装最新 CLI?
curl -LsSf https://hf.co/cli/install.sh | bash
引用该论文的模型 0
暂无模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2604.15760 即可在此页面显示链接。
引用该论文的数据集 0
暂无数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2604.15760 即可在此页面显示链接。
引用该论文的 Spaces 0
暂无 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2604.15760 即可在此页面显示链接。
包含该论文的 Collections 0
暂无 Collection 包含此论文
将该论文添加到收藏(https://huggingface.co/new-collection)即可在此页面显示链接。
相似文章
知识工作的设计与报告基准
本文提出一个三步框架,用于设计和报告知识工作AI的基准,强调基准任务与实际工作活动之间的一致性。它从O*NET数据库中推导出18种工作活动,并分析了三个现有基准(GDPval、OfficeQA Pro、APEX-SWE),以展示基准分数与实际工作能力之间的差距。
MHGraphBench:基于知识图谱的大语言模型心理健康知识基准测试
本文介绍了MHGraphBench,这是一个基于知识图谱的基准测试,用于评估大语言模型在心理健康知识方面的能力,包括实体识别、关系判断和多跳推理。对15个LLM的实验揭示了识别能力与判断能力之间存在差距。
通过基准构建教授AI:QuestBench作为负责任知识工作的课程实践
本文介绍了QuestBench,这是一个由学生构建的基准,用于评估人文和社会科学领域的深度研究系统。结果显示,即使是像GPT-5.5这样的先进系统也只能通过57.58%的问题,突显了可信度方面的失败。
WildTableBench:在真实场景中评估多模态基础模型的表格理解能力
WildTableBench 提出了首个针对真实世界表格图像的问答应答基准,揭示了现有多模态基础模型在结构感知和数值推理方面存在显著困难,仅有1个模型准确率超过50%。
LLM置信度估计的不同方法基准测试
本文对LLM置信度估计的各种黑盒与白盒方法进行了基准测试,包括口头化置信度、语言不确定性、推理长度、P(Answer)、P(True)和自我一致性,比较它们在主动学习和安全分类等任务中的有效性。