在没有扩散历史的情况下预测消费科技产品的普及率
摘要
本文测试了由人类和前沿语言模型评定的消费科技产品感知属性,是否比上市年数更能预测普及率,结果发现虽有适度改进,但在短期预测方面存在局限。
arXiv:2608.12344v1 公告类型:新
摘要:我们测试了消费科技产品的感知属性能否预测其普及程度。在2022年一项针对美国成年人的Prolific调查中(n = 678),受访者对65种消费科技产品的六项属性进行了评分。随后,我们让两个前沿语言模型——Anthropic Claude Opus 4.7和OpenAI GPT-5.5——给出相同的评分。我们使用带符号约束的惩罚回归,将普及率对四个UTAUT2接受度属性加上对数年龄协变量进行回归,并采用每次留出一种技术的方式进行评估。属性模型优于仅基于上市年数的基线:使用人类评分时平均绝对误差下降17%,使用任一模型时下降更多,其中Opus 4.7下降最明显。在2022年至2025年的短期窗口内,普及率变化不大,相同属性并未优于无变化基线。我们阐述了该方法的局限性,包括语言模型评分可能反映的是这些技术的先验知识而非独立的属性推理。我们还提供了部署示例:对2025年和2026年推出的11款产品的2027年普及率预测。
查看缓存全文
缓存时间: 2026/08/14 09:25
# 在没有扩散历史的情况下预测消费技术的拥有率 来源:https://arxiv.org/abs/2608.12344 查看PDF(https://arxiv.org/pdf/2608.12344) > 摘要:我们测试了消费技术的感知属性是否能预测其拥有普及程度。在一项2022年针对美国成年人的Prolific调查(n = 678)中,受访者就六项属性对65种消费技术进行了评分。随后,我们让两个前沿语言模型——Anthropic Claude Opus 4.7和OpenAI GPT-5.5——给出了相同的评分。我们使用带符号约束的惩罚回归,将拥有率对四个UTAUT2接受属性加上一个对数年龄协变量进行回归,并每次留出一个技术进行评估。属性模型相较于以发布年数为基线的模型有所改进:使用人类评分时平均绝对误差下降17%,使用任一模型时下降更多,其中Opus 4.7下降最多。在2022年至2025年的短暂窗口期内,拥有率变化不大,相同的属性并未优于无变化基线。我们阐述了该方法的局限性,包括语言模型的评分可能反映其对这类技术的先验知识,而非独立的属性推理。我们提供了一个部署示例:对2025年和2026年发布的11款产品的2027年拥有率预测。 ## 提交历史 来自:Pontus Strimling [查看电子邮件](https://arxiv.org/show-email/17f087a4/2608.12344) **[v1]** 2026年6月3日星期三 17:58:00 UTC(1,075 KB)
相似文章
@dair_ai: 前沿模型能预测科学进展吗?大多数情况下不行,但原因如下。这项工作研究了4760个科学事件…
一项研究评估了前沿模型预测科学进展的能力,涵盖4760个事件,发现它们可以识别可能的方向,但无法可靠预测结果或时间线,且存在系统性过度自信。
@rohanpaul_ai: 谷歌新论文:预测需要上下文,而不仅仅是历史。有些模式是由事件而非时间引起的。Nexus 重新定义……
谷歌的Nexus论文提出了一种智能代理框架,将上下文事件与数值数据结合用于时间序列预测,在Zillow测试中相比直接思维链提示实现了86.6%的平均绝对百分比误差(MAPE)降低。
从文本描述预测初创企业退出——一个计算语言学框架
本研究应用计算语言学和监督式机器学习,仅凭文本描述即可预测早期初创企业的退出情况,发现创始人叙述携带预测信号,并引入了一个可量化的夸张得分(Hyping Score)。
扩散模型与自回归模型之争终于有了一个干净的数据点,而它所指向的结论远比炒作中的更窄
LLaDA2.2背后的实验室发布了一个扩散模型,并将其与自家的自回归模型进行基准测试,结果显示扩散模型在通用知识和编程方面落后,但在速度和智能体任务上胜出,提供了一个清晰的权衡数据点。
不确定但确信:揭示扩散语言模型中的表征-置信度差距
本文识别出扩散语言模型中的“表征置信度差距”:内部状态能准确检测输入噪声,但报告的置信度在高噪声下仍保持高位,答案排序能力下降。本文引入了一种轻量级、无需训练的信息提取工具,利用隐藏状态改进排序,而无需修改基础模型。