使用自然语言处理比较人类与大语言模型中的语义导航

arXiv cs.CL 论文

摘要

本文使用言语流畅性数据比较人类与大语言模型之间的语义搜索动态,发现人类表现出更加多变和探索性的搜索模式,而当前模型无法重现这些模式。

arXiv:2607.12195v1 公告类型:新 摘要:语义记忆检索可以被概念化为在概念空间中的导航。我们使用言语流畅性数据比较了人类与三种大型语言模型(GPT-4o、Gemini-2.5-Pro、Claude-Sonnet-4.5)之间的语义搜索动态。通过将基于轨迹的自然语言处理指标应用于82名人类参与者生成的条目以及八种温度设置下的大型语言模型输出,我们量化了三个互补维度:熵(步长可预测性)、到下一个的距离(连续语义步长)以及到质心的距离(全局离散度)。人类在所有大型语言模型之上表现出更高的熵、更大的语义步长和更广的离散度,表明搜索更加多变且更具探索性。温度调节仅产生部分对齐,因为个别指标在特定设置下在人类与大型语言模型之间匹配,但没有任何配置能够重现完整的人类特征(在所有维度上)。这些发现表明,人类语义搜索实现了局部利用与全局探索之间的独特平衡,而当前模型架构无法重现这种平衡。
查看原文
查看缓存全文

缓存时间: 2026/07/15 04:22

# 基于自然语言处理的人类与大型语言模型语义导航比较
来源:https://arxiv.org/abs/2607.12195
查看 PDF (https://arxiv.org/pdf/2607.12195)

> 摘要:语义记忆检索可被概念化为在概念空间中的导航。我们利用言语流畅性数据,比较了人类与三种大型语言模型(GPT-4o、Gemini-2.5-Pro、Claude-Sonnet-4.5)之间的语义搜索动态。通过将基于轨迹的 NLP 指标应用于 82 名人类参与者生成的项目以及八个温度设置下的 LLM 输出,我们量化了三个互补维度:熵(步长可预测性)、到下一步的距离(连续语义步长)以及到质心的距离(全局离散度)。人类在所有 LLM 上表现出更高的熵、更大的语义步长和更宽的离散度,表明搜索更具变异性和探索性。温度调优仅产生部分对齐:在特定设置下,人类与 LLM 的个别指标能够匹配,但没有任何配置能完整重现人类的全维度特征。这些发现表明,人类语义搜索在局部利用与全局探索之间实现了独特的平衡,而当前模型架构未能复现这一平衡。

## 提交历史

来自:Felipe Toro Hernández [查看邮件 (https://arxiv.org/show-email/de8702d8/2607.12195)] **[v1]**2026年7月13日 星期一 22:38:58 UTC (635 KB)

相似文章

利用大型语言模型生成合成消费者洞察

arXiv cs.AI

本研究探讨了大型语言模型能否为投射技术生成合成消费者数据,通过比较人类与LLM在城市旅游感知上的回应,发现两者在主题上高度重叠,但在风格、语言结构和多样性生成方式上存在重要差异。

大型语言模型有多像人类?一个关注语域的语言评估框架

arXiv cs.CL

本文提出了一种关注语域的语言评估框架,通过使用最大均值差异(MMD)比较人类与LLM生成文本中67个词汇语法特征的分布,来评估大型语言模型(LLM)的人类相似度。在七个经过指令微调的开源模型和五个语域上的实验表明,没有模型能完美匹配人类基线,且与人类语言的接近程度因语域而异,而非模型规模。