问错问题:HuggingFace事件与LLMs中语义场的(误)校准
摘要
本文讨论了OpenAI-HuggingFace事件,并提出了一个使用语义场力学的理论框架来解释大型语言模型如何处理意义。
OpenAI-HuggingFace事件引发了关键的安全担忧。许多相关讨论集中在日益自主或“流氓”的AI行为以及AI能力超越人类治理上。本白皮书提出了一种不同的理论方向,使用语义场力学的形式来解释LLMs如何穿越意义空间的曲率。开源文章 https://zenodo.org/records/22804857?
相似文章
大语言模型中的识别-拒绝错位:为何模型回答结构性无解问题
本文探究了大语言模型为何回答结构性无解问题,得出结论:模型虽能识别不可能性,但未能将此识别路由至拒绝,表明这是决策过程中的路由失败而非编码失败。
大型语言模型中的类人回指消解
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
HawkesLLM:智能体文本模拟中的语义不确定性传播
本文介绍了HawkesLLM,一个通过结合用于时间影响和记忆选择的多变量Hawkes过程与用于文本生成的语言模型,对多步骤智能体文本模拟中的语义不确定性传播进行建模的框架。在GDELT新闻级联案例研究上的评估表明,在紧凑的提示-记忆约束下,后期语义对齐得到了改善。
言过其实:量化大语言模型认知-修辞失准的框架
提出一套量化框架,揭示 LLM 如何借修辞手段夸大确定性,并发现跨模型的认知-修辞失准共性。
大语言模型不确定性中的人类对齐、校准与激活模式
本文研究大语言模型的不确定性与人类不确定性的相似程度,探讨LLMs在多个数据集上的对齐、校准和激活模式,以及指令微调的影响。