大语言模型的维度级意图保真度评估:来自结构化提示消融的证据
摘要
本文介绍了一种使用结构化提示消融来测量大语言模型意图保真度的维度级评估方法。
arXiv:2605.14517v1 公告类型:新
摘要:整体评估分数捕捉了输出的整体质量,但无法区分模型是再现了用户请求的结构形式,还是保留了用户的特定意图。我们提出了一种维度级意图保真度评估框架,通过一项结构化提示消融研究,覆盖了三种语言、三个任务领域和六个大语言模型的2,880个输出,分别测量每个语义维度的结构恢复和意图保真度。该框架揭示了一个系统性的结构-保真度分裂:在具有完整配对分数的中文语言输出中,25.7%获得了完美的整体对齐分数(GA=5),同时表现出可测量的维度意图缺陷;而在英文语言输出中,这一比例上升至58.6%。人工评估证实,这些分裂区域输出代表了真正的质量缺陷,并且维度保真度分数比整体分数更可靠地追踪了人类判断。对2,520个消融细胞进行的公共-私有分解描述了模型何时成功补偿缺失意图以及何时失败,而代理标注则区分了先验可推断性与默认可恢复性。一项权重扰动实验表明,中等程度的不对齐通常被吸收,而严重的维度反转则始终有害。这些发现表明,在评估大语言模型针对用户特定任务的输出时,维度级意图保真度评估是整体评估的必要补充。
查看缓存全文
缓存时间: 2026/05/15 06:22
# 大语言模型维度级意图保真度评估:来自结构化提示消融实验的证据 来源:https://arxiv.org/abs/2605.14517 参考文献工具 ## 参考文献与引用工具 文献浏览工具 代码、数据与媒体 ## 本文相关的代码、数据与媒体 演示 ## 演示 相关论文 ## 推荐与搜索工具 关于arXivLabs ## arXivLabs:与社区合作者的实验项目 arXivLabs 是一个框架,允许合作者直接在网站上开发和分享 arXiv 的新功能。 与 arXivLabs 合作的个人和组织都接受并认同我们关于开放、社区、卓越和用户数据隐私的价值观。arXiv 致力于践行这些价值观,并仅与遵循这些价值观的合作伙伴合作。 有一个能为 arXiv 社区增添价值的项目想法吗?**了解更多关于 arXivLabs 的信息**(https://info.arxiv.org/labs/index.html)。
相似文章
确认我们的偏见?评估大型语言模型的能力、风险与社会影响
这篇预印本评估了六个大型语言模型在160个提示词中对提示框架和偏见提示的响应方式,发现LLMs即使在事实性语境下也会系统性地调整其响应以与提示框架保持一致,从而可能强化用户的偏见。
超越准确率:大型语言模型统计推理的多维评估
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
大语言模型中的语言习得装置
本文提出了一种受LAD启发的预预训练方法,使用一种名为MP-Struct的形式语言,该语言编码了类自然语言结构。研究表明,这种方法提高了token效率,并赋予了模型类似人类的对结构不合理语言的抵抗力,挑战了先前关于有效预预训练语言的假设。
IntentGrasp:意图理解的综合基准测试
本文引入了 IntentGrasp,这是一个用于评估大型语言模型意图理解能力的综合基准测试,揭示了 20 个测试模型表现不佳的问题。论文提出了有意图微调(Intentional Fine-Tuning, IFT)作为解决方案,该方法显著提升了模型性能,并展现出强大的跨领域泛化能力。