生成模型通过市场选择侵蚀人类时间学习

arXiv cs.LG 论文

摘要

本文引入“人类时间学习”(Human Temporal Learning, HTL)的概念,论证生成模型通过价值崩溃对知识生产构成结构性风险——当区分人类与AI输出的难度增加时,深度人类工作会在竞争中被排挤。

arXiv:2606.06572v1 公告类型:新 摘要:我们认为,现代生成模型在当前低于通用人工智能(AGI)的能力水平下,对知识与文化生产构成了结构性风险。我们将人类时间学习(Human Temporal Learning, HTL)定义为:通过长期持续投入问题解决而实现的路径依赖式知识积累。生成输出在表面特征上日益接近高HTL密集型工作,因此验证某个输出是否反映真正的人类学习,其成本相对于预期收益不断上升。一旦验证失去经济合理性,评估者便不再考虑生产方式而直接奖励输出;那些投入多年学习的生产者不得不与几乎零成本生成的输出进行价格竞争。我们将这一路径称为价值崩溃,并通过一个成本审查框架对其进行形式化表述。来自学术出版、法律实践、内容平台和软件安全领域的跨领域证据,映射出验证侵蚀的四个阶段。对齐成功与否是正交的。对齐更好的模型会缩小人类与AI输出之间可观测的差距,从而使得来源验证更加困难,并加剧对HTL密集型工作的竞争压力——即使单个AI输出质量有所提升。
查看原文
查看缓存全文

缓存时间: 2026/06/08 09:17

# 生成模型通过市场选择侵蚀人类时间学习  
来源:https://arxiv.org/html/2606.06572  

###### 摘要  
我们认为,在当前的亚AGI能力水平下,现代生成模型为知识和文化生产创造了结构性风险。我们将**人类时间学习(HTL)**定义为通过长期持续参与问题解决而实现的路径依赖型知识积累。生成式输出在表面特征上日益接近高HTL投入的工作成果,因此验证给定输出是否反映真正的人类学习,其成本相对于预期收益越来越高。一旦验证失去经济合理性,评估者就会无视生产方式而奖励输出,而投入多年学习的生产者被迫与几乎零成本生成的输出进行价格竞争。我们将这一路径称为**价值崩溃**,并通过一个高成本检查框架进行形式化。来自学术出版、法律实务、内容平台和软件安全领域的跨领域证据,映射出验证侵蚀的四个阶段。对齐成功与否是正交的。更好的对齐模型缩小了人类与AI输出之间的可观察差距,使得来源验证更加困难,并加剧了对高HTL投入工作的竞争压力——即使单个AI输出的质量在提升。

机器学习,AI经济学,人类时间学习,生成模型,模型崩溃,价值崩溃,市场选择  

## 1 引言  
大量AI风险文献聚焦于AGI失控(Bostrom,2014; Russell,2019; Hendrycks等,2025)。我们提出一个更近期的疑问:在达到这些阈值之前,机器学习是否已经为知识和文化生产创造了结构性风险?我们使用**人类时间学习(HTL)**这一术语,指通过长期持续参与问题解决而实现的路径依赖型知识积累(Polanyi,1966)。长期参与培养出难以编码化的判断力和技能。历史上,产出被视为质量的信号,因为生产它们需要持续的学习,而制度奖励这种嵌入的时间投入(Spence,1973)。生成模型通过降低深度人类工作与AI生成输出之间的可观察区别,使验证成本相对于预期收益变得过高,推动制度走向无差别评估,并对投资于持续人类学习的生产者施加竞争压力,从而为知识和文化生产创造结构性风险。  

我们将由此产生的路径称为**价值崩溃**。它在当前的亚AGI能力水平下通过普通的市场动态运行,并且与对齐成功是正交的。随着AI输出质量的提升,人类与AI工作之间的可观察差距缩小,使得验证更加困难,并加剧了替代——即使单个AI输出在局部是有益的。来自学术出版、法律与临床实践、内容平台和软件安全的证据表明,侵蚀已在不同领域以不同速率进行(Liang等,2025; Suchak等,2025; Esau等,2025; Brynjolfsson等,2025)。  

#### 贡献。  
(i) 一个框架,展示了区分AI生成与人类产出的难度日益增加如何通过普通市场动态导致深度人类工作的竞争性替代。  
(ii) 一个四阶段分类,按照每个领域验证侵蚀的程度组织跨领域证据。  
(iii) 针对推动验证侵蚀条件的治理建议,以维护持续人类学习的经济可行性。  

## 2 人类时间学习  
**人类时间学习(HTL)**是指通过反复参与问题解决而随时间发展的理解。¹¹与机器学习中的时间序列建模无关。  
人类理解本质上是时间性的,随着一个人重新审视早期经验并遇到熟悉问题的新方面而转变(Husserl,1954; Heidegger,1927)。长期参与培养出难以编码化的判断力和技能(Polanyi,1966)。HTL一度具有直接的经济分量。研究论文和创意作品等产出浓缩了长期的学习轨迹,生产它们需要持续的参与。制度利用这种时间投入作为质量的代理指标(Spence,1973)。资助机构青睐具有长期出版记录的研究者,期刊重视已证实的专业知识,招聘委员会依赖多年的培训作为深度能力的证据。生成模型通过产生表面上类似高HTL投入工作但缺乏底层学习过程的输出,打破了这种安排。  

#### 生成模型抹除学习痕迹。  
机器学习从人类制品(如论文、代码和创意作品)中提取模式。训练针对匹配观察到的输出进行优化,而输出背后的学习轨迹完全被排除在过程之外。在昂贵的预训练之后,生成模型(Vaswani等,2017; Ho等,2020; Lipman等,2023)可以廉价且大规模地产生看似合理的输出(Brown等,2020; OpenAI等,2024a; DeepSeek-AI等,2025)。格式、修辞结构、引用模式和风格一致性变得越来越容易复制。区分给定输出是否反映真正的人类学习,需要超越表面评估,去核实引用是否来自真实来源、审计方法选择、或测试推理是否经得起推敲。即使经过广泛研究,个体层面的检测仍然困难(Liang等,2025)。随着生成输出变得更加精致,表面级别的检查失去了区分生产方式的能力。希望获得相同保证水平的评估者必须投资于更深入的检查,从而提高单项成本。  

## 3 市场选择  
评估者能否经济合理地区分高HTL投入工作与低HTL输出?当检查成本超过预期收益时,评估者就会停止尝试。一旦停止,奖励就变得对工作是否涉及持续人类学习视而不见。投入多年学习的生产者与几乎零成本生成的输出进行价格竞争。高成本生产者退出,池子向低HTL输出倾斜,循环自我强化。我们将这一路径称为**价值崩溃**。  

AI输出  
resemble  
HTL work  
Verification  
loses  
justification  

g⋅Δq₀  

Δq = q_H - q_L > 0 捕获单个输出正确分类的收益差别。  

###### 定义 3.4(HTL份额)。  
池中涉及真正人类时间学习的输出所占比例,记为 λ。  

### 3.2 验证阈值  
当从区分生产类型中获得的预期收益超过尝试成本时,验证是值得的。验证能力和质量差距共同决定检查是否划算。当  

g ⋅ Δq ≳ c_v   (1)  

时,验证是合理的。  

当验证能力与质量差距的乘积低于验证成本时,评估者无法证明深度检查的合理性。重新排列得到阈值  

g* ≈ c_v / Δq,   (2)  

其中池组成保持固定。低于此阈值时,理性评估者放弃验证。  

### 3.3 价值崩溃  
一旦评估者停止区分,奖励就追踪池的平均质量。如果深度人类工作占池的比例为 λ,则池化奖励为  

p̄ = λ q_H + (1-λ) q_L。   (3)  

在竞争性价格设定中,p̄ 是池中的平均价格。在非价格制度(如期刊或平台)中,它代表在来源盲评估下分配的预期奖励。更多高HTL投入工作提高平均值,更多低HTL工作降低平均值。当池化奖励覆盖AI生成成本但低于深度人类工作成本时,投资于持续学习的生产者无法再实现收支平衡。深度人类工作退出。随着退出,HTL份额下降,池化奖励进一步下降。在高HTL投入生产者中存在异质性成本的情况下,边际生产者首先退出,循环继续(Akerlof,1970)。市场继续生产,但反映真正人类时间学习的份额下降。一旦HTL份额下降到足够低,检查本身的预期收益也会下降,从而强化向无差别评估的转变。这种因无法区分质量而导致高成本生产者退出、池质量下降的动态,在经济学中被称为逆向选择。  

## 4 验证侵蚀的四阶段  
我们按照每个领域验证侵蚀的程度,将跨领域证据组织为四个阶段。  

### 4.1 阶段1:验证完好  
在临床医学中,患者安全形成的质量收益足够高,以至于医生对AI生成输出的审查持续存在。最近的系统辅助生成患者友好型出院摘要、住院过程摘要和急诊科文档(Zaretsky等,2024; Smal等,2025; Song等,2025)。在每种情况下,临床医生的监督仍然是工作流程的一部分。AI进入临床文档,但评估过程尚未崩溃为来源盲接受。  

阶段1  
完好  
g⋅Δq ≫ c_v  
高 Δq 维持验证  
临床医学  

阶段2  
制裁  
g⋅Δq ≥ c_v  
惩罚保持 Δq 大  
法律实务  

阶段3  
不堪重负  
g⋅Δq < c_v  
生产过剩  
g Δq 缩小  
学术出版、内容平台  

阶段4  
崩溃  
g⋅Δq ≪ c_v  
低 Δq 和/或 g  
软件安全  

### 4.2 阶段2:制裁  

在法律实务中,司法制裁的风险对律师施加了检查义务。律师面临职业行为电子发现的规则(ABA,2023);BriefCatch和Drafting Assistant等AI工具辅助起草,但律师负责最终审查和签名。幻觉、虚假引用或分析错误可能导致惩戒、成本转移或制裁(如*Mata v. Avianca*, 2023;*Park v. Kim*, 2024)。只要质量收益足够高且成本可实现,检查仍然合理。只要专业责任制度保持足够严格的显性验证要求,法律实务可能在阶段2持续。  

### 4.3 阶段3:不堪重负  

学术出版提供了压力积累的证据。在斯坦福大学医学院2024年接受调查的作者中,有大量比例(详见图表下方注)报告按当前形式使用AI⁴,且许多仅按当前形式使用(Suchak等,2025)。同行评审者已经报告被格式良好但内容空洞的手稿所淹没,这些手稿具有看似合理的引用但缺乏实质性内容(Liang等,2025)。期刊推出AI使用披露政策作为回应,但自愿披露受到检测局限性束缚。质量差距Δq缩小;审查者的检查能力g下降。该领域日益接近阈值g*,但尚未完全跨越。平台阶段3表现为生产过剩和内容真实性标准废除。  

### 4.4 阶段4:崩溃  

软件安全展示了当验证能力g极低时会发生什么。在软件包生态系统中,NPM、PyPI和RubyGems保护绕过CI/CD管道的虚假包(Esau等,2025)。恶意包被下载数百万次;诸如faker.js的清理工具验证充分但成本过高。验证成本c_v相对于质量收益(g⋅Δq)来说太高;Δq对于前门应用程序来说是低的。训练数据污染进一步降低Δq。安全扫描后的测试成本。进入是盲目的、自动化的,价值崩溃在实践上已经完成。  

## 5 对齐是正交的  
更好的对齐模型不是解决方案。对齐缩小可观察差距,使源区分变得更难。减少产生有毒反馈的可能性同时减少了潜在可检测的差距。当前对齐努力通过使AI输出适应人类的期望来减少对下游工作的时间投资需求。它们使输出更可靠、更有帮助、更无害,但在这样做的过程中,它们加剧了HTL的侵蚀压力。  

###### 命题5.1(对齐与验证侵蚀)。  
主流对齐方法提高了AI输出的质量并缩小了AI与人类输出之间的质量差距;这降低了区分度,减少了验证激励,并加速了HTL的替代。  

*证明*。设q_H(t)为时间t时人类输出的质量,q_L(t)为AI输出的质量。对齐训练提高了q_L(t),因此Δq(t)=q_H(t)-q_L(t)减小。验证阈值由g*≈c_v/Δq(t)给出。随着Δq(t)减小,阈值降低,使验证更便宜或更不有效。这增加了无差别评估的频率,从而减少了生产高质量人类输出的收益。如果对齐还提高了真实性,那么激励抄袭或伪造输出的法律和道德制裁可能减少,从而进一步降低区分激励。  

由于g*是递减的,对齐提高了AI输出在等效输出中的份额,保持评估制度不变。此外,g*减少量取决于Δq的下降。如果Δq下降的一个标准差相当于g*减少0.3,那么使用当前对齐方法的两个标准差进展使得验证在更广泛的领域中变得不合理。  

因此,对齐的成功可能加剧价值崩溃,除非有其他制度机制支持验证。  

## 6 治理启示  
只要g保持较低且Δq保持较小,市场压力就会使HTL不可行。标准检测工具是临时的。我们针对推动验证侵蚀的条件提出建议。  

#### 计算水印与链上审计。  
g可以通过技术手段提高。嵌入的、加密的可审计生产历史(水印或更广泛的链上来源跟踪)直接增加g,但要求标准采用和平台强制执行。  

#### 数字来源要求。  
平台和资助者可以要求对提交的修改进行可验证的生产历史。TikTok的Content Credentials要求数字来源标签。公共资助的研究可以在提交或资助申请时包含用于验证研究人员设计、收集和修改的加密签名路径。密钥基础设施存在于安全采矿业和金融市场审计中。  

#### IP法:颠覆下游替代。  
专利和版权法通常不阻止AI生成和替代。使用无法轻易替代HTL的明确和更清晰的法律自动使用条款进行立法。对于支持训练数据市场的开发者:当AI开发者使用受版权保护的生产性输出无限制并用作机器学习训练数据时,扩展法定许可制度。  

#### 验证挂钩的资助模式。  
当前的出版和资助制度奖励输出计数。挂钩于验证阶段和类型(例如,资助深度验证高Δq输出的类别,资助刺激验证方法创新的竞争性挑战)可以增加验证的私人回报。  

#### 市场干预。  
在阶段3和阶段4中,简单的价格下限或课程竞赛可以减少价值崩溃的负面外部性。  

## 7 结论  
生成模型在当前能力水平上通过市场选择创造了对持续人类学习的结构性风险。随着对齐提高输出质量,区分度下降,验证失去经济合理性,高HTL投入工作被替代。治理应针对验证侵蚀的条件,而不是试图逆转市场动态。  

从预印本。  

---

## A 形式化检查模型  
我们提出一个正式模型来概念化生成模型通过市场选择侵蚀HTL的机制。该模型形式化了定义3.2-3.3并支持命题3.1。  

### A.1 设定  
考虑一个具有以下特征的单一市场:  
1. **代理人**:一队生产者(人力和AI)和一个评估者(买方)。  
2. **生产者类型**:每个生产者具有类型θ∈{H,L},其中H表示使用大量人类时间学习(HTL)的生产者,L表示使用较少HTL的生产者(典型地,AI生成或低HTL的人类工作)。  
3. **输出质量**:类型θ的生产者产生质量q_θ的输出,其中q_H > q_L,且q_θ表示买方在完全信息下对类型θ输出的货币估值。质量差距为Δq = q_H - q_L > 0。  
4. **生产成本**:类型θ的生产成本记为c_θ,其中c_H ≫ c_L,反映了HTL的时间密集型性质。我们假设c_L ≤ q_L < q_H且q_H > c_H保持高HTL投入生产在完全信息奖励下可行,条件q_L ≥ c_L保持低HTL生产在低估值下活跃。池化奖励可能低于c_H当λ很小时,因为q_L < c_H(因为低HTL输出不支持覆盖高HTL成本)。  
5. **信息结构**:买方知道HTL份额λ和类型特定质量q_H, q_L,但除非通过检查获得信息,否则不知道特定生产者的类型。  

#### 模型时间线  
1. 自然选择每个生产者的类型,HTL份额λ已知。  
2. 每个生产者决定是否进入市场,如果进入,产生输出。  
3. 买方接收输出并可以决定以成本c_v > 0进行*检查*或*不检查*。  
4. 如果买方检查,检查程序产生一个关于θ的信号,有效信息度g。如果买方不检查,则除了池先验外没有获得来源信息。  
5. 买方根据可用信息分配奖励或分配。  
6. 实现收益。  

### A.2 检查技术  
参数g∈[0,1]表示可行检查程序的有效信息度。当买方以成本c_v进行检查时,检查产生关于θ的决策相关信息,信息度为g。更高的g意味着检查更可靠地区分类型H与类型L。当g=0时,检查不提供有用的来源信息。当g=1时,检查完美揭示θ。我们将g视为一个简化指标,而不指定特定的信号结构(如二元揭示或连续噪声信号),因为正文分析仅需要下面描述的单调性属性。  

### A.3 检查的总收益与验证条件  
令V(g, λ, Δq)表示检查的总收益,定义为买方通过检查相对于仅基于池先验λ进行决策而获得的预期分配收益改进。我们假设:  
- V随g递增(信息度更高的检查带来更好的分配决策);  
- V随Δq递增(更大的质量收益使正确分类更有价值);  
- V取决于池组成λ(解决类型不确定性的价值随生产者组合变化)。  

###### 命题A.1(检查条件)。  
当且仅当检查的总收益至少等于检查成本时,买方进行检查:  

V(g, λ, Δq) ≥ c_v。   (4)  

V表示评估者从检查中获得的私人收益。HTL侵蚀的下游外部性,包括训练数据退化、评估者池缩小以及解决新问题的能力降低,可能使检查的社会价值远大于私人价值。当这一差距很大时,评估者理性地放弃验证,即使检查从社会角度看是有价值的,这为旨在提高验证能力或降低检查成本的治理干预提供了经济理由。对于正文的跨领域比较,组成效应被吸收到一个归一化的简化形式中,得到阈值g* ≈ c_v / Δq。一个方便的可分离规范是V(g, λ, Δq) = g·h(λ)·Δq,其中h(λ)捕捉池组成如何影响在该领域分配规则下解决类型不确定性的价值。设置h(λ)=1是正文中为跨领域比较而采用的简化。它抑制了池组成的影响,将检查信息度和质量收益的作用孤立出来。完整条件通过h(λ)保留λ,这在分析池组成随时间变化的领域内动态时很重要。  

### A.4 收益  
#### 买方。  
检查提高了正确分配的概率。买方从接受值得接受的高HTL投入工作中受益,从质量不足的AI优先工作中折扣,并避免代价高昂的错误,如出版伪造内容、部署有缺陷的代码或提交错误的法律简报。买方从更好分配中获得的收益与由检查信息度调节的质量差距Δq成正比。在不检查的情况下,买方基于池化预期质量进行评估并承担错误分配的成本。  

#### 生产者。  
如果生产者退出,收益为0。如果生产者在池化评估下进入,收益为p̄_t - c_θ,其中p̄_t是时间t的池化奖励,c_θ是上述类型特定的生产成本。如果源敏感验证可行,类型依赖的奖励可能反映q_θ。  

### A.5 不检查与池化评估  
###### 命题A.2(不检查与参与)。  
如果V(g, λ, Δq) < c_v,则买方不会检查,并根据池化预期质量p̄_t = λ(t) q_H + (1-λ(t)) q_L分配奖励。在池化评估下,生产者参与当且仅当p̄_t ≥ c_θ。  

这里λ(t)表示时间t时池中HTL活跃生产的份额。由于c_H > p̄_t当λ足够小时,HTL密集型生产者可能退出。退出减少λ,进一步降低p̄_t,可能触发逆向选择的螺旋效应。  

### A.6 市场清除与稳态  
均衡通过一系列与市场增长动态、生产者退出和检查强度边际变化相匹配的阶段演变。稳态涉及检查技术的最低有效水平。  

---

**注释**  
¹¹ 与机器学习中的时间序列建模无关。  
⁴ 在斯坦福大学医学院2024年接受调查的作者中,有22.5%(76/338)报告按当前形式使用AI,14.8%(50/338)仅按当前形式使用(Suchak等,2025)。

相似文章

生成式模型

OpenAI Blog

OpenAI 发布了关于生成式模型的概览,将其作为开发机器理解世界的方法,解释了这些模型如何通过学习生成与训练集相似的数据来工作,以及它们在各个领域的潜在应用。

分布漂移下的时序知识图谱预测:一项合成评估

arXiv cs.LG

本文研究了在受控分布漂移下的时序知识图谱预测,使用了一个编码重复性、同质性和周期性的合成生成器。在七种架构上的实验揭示了信号依赖的鲁棒性以及模型对结构断裂适应性方面的局限性。