在没有扩散历史的情况下预测消费科技产品的普及率

arXiv cs.CL 论文

摘要

本文测试了由人类和前沿语言模型评定的消费科技产品感知属性,是否比上市年数更能预测普及率,结果发现虽有适度改进,但在短期预测方面存在局限。

arXiv:2608.12344v1 公告类型:新 摘要:我们测试了消费科技产品的感知属性能否预测其普及程度。在2022年一项针对美国成年人的Prolific调查中(n = 678),受访者对65种消费科技产品的六项属性进行了评分。随后,我们让两个前沿语言模型——Anthropic Claude Opus 4.7和OpenAI GPT-5.5——给出相同的评分。我们使用带符号约束的惩罚回归,将普及率对四个UTAUT2接受度属性加上对数年龄协变量进行回归,并采用每次留出一种技术的方式进行评估。属性模型优于仅基于上市年数的基线:使用人类评分时平均绝对误差下降17%,使用任一模型时下降更多,其中Opus 4.7下降最明显。在2022年至2025年的短期窗口内,普及率变化不大,相同属性并未优于无变化基线。我们阐述了该方法的局限性,包括语言模型评分可能反映的是这些技术的先验知识而非独立的属性推理。我们还提供了部署示例:对2025年和2026年推出的11款产品的2027年普及率预测。
查看原文
查看缓存全文

缓存时间: 2026/08/14 09:25

# 在没有扩散历史的情况下预测消费技术的拥有率
来源:https://arxiv.org/abs/2608.12344
查看PDF(https://arxiv.org/pdf/2608.12344)

> 摘要:我们测试了消费技术的感知属性是否能预测其拥有普及程度。在一项2022年针对美国成年人的Prolific调查(n = 678)中,受访者就六项属性对65种消费技术进行了评分。随后,我们让两个前沿语言模型——Anthropic Claude Opus 4.7和OpenAI GPT-5.5——给出了相同的评分。我们使用带符号约束的惩罚回归,将拥有率对四个UTAUT2接受属性加上一个对数年龄协变量进行回归,并每次留出一个技术进行评估。属性模型相较于以发布年数为基线的模型有所改进:使用人类评分时平均绝对误差下降17%,使用任一模型时下降更多,其中Opus 4.7下降最多。在2022年至2025年的短暂窗口期内,拥有率变化不大,相同的属性并未优于无变化基线。我们阐述了该方法的局限性,包括语言模型的评分可能反映其对这类技术的先验知识,而非独立的属性推理。我们提供了一个部署示例:对2025年和2026年发布的11款产品的2027年拥有率预测。

## 提交历史

来自:Pontus Strimling [查看电子邮件](https://arxiv.org/show-email/17f087a4/2608.12344) **[v1]** 2026年6月3日星期三 17:58:00 UTC(1,075 KB)

相似文章

不确定但确信:揭示扩散语言模型中的表征-置信度差距

arXiv cs.CL

本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。