朝向以单元作为原语的机器学习:从单元关联事件中学习
摘要
本文提出将'单元'作为机器学习中的显式原语,其中学习任务声明持久个体,而监督学习则特化为带有分词的单元条件响应法则。
arXiv:2608.25118v1 公告类型:新
摘要:机器学习通常通过样本形式化,但多个观察或可能事件所指的持久个体往往保持隐含。我们提出将\emph{单元}作为任务语义层面的显式原语。学习任务首先声明一个持久指代对象的总体和一个相同性准则;实现值$u$表示所选指代对象。监督学习是主要的形式特化。其语义对象是一族单元条件响应法则。齐次性是这些法则重合的特殊情况;仅基于样本的条件对于世界是齐次的还是观察法则仅为异质族的边缘分布是沉默的。从数据中学习到的是一个对$(T_\phi,R_\theta)$:一个分词器,它产生上下文单元标记,以及一个共享的响应法则形式来读取它。结构化类将该形式视为标记中的简单关系;线性预测器是运行实例。标记是学习者端的表示,通过它任务端的单元影响预测,而省略单元信息的学习者规范对单元不敏感;齐次性仍然是世界端响应族的属性。当身份未解决时,世界端法则混合单元条件目标,而学习者将其共享形式与标记组合。一个可信的解析器可以固定单元并提供查找标记;否则\emph{单元推断}从事实证据形成相同类型的标记。未链接的单行观察可能无法区分异质单元世界与同质合并世界;可信的同单元对分离受限的见证。形式结果涉及这一监督特化。
查看缓存全文
缓存时间: 2026/08/27 09:33
# 以单元为基本要素走向机器学习:从单元关联事件中学习
来源:https://arxiv.org/html/2608.25118 2026年8月26日
###### 摘要
机器学习通常通过样本进行形式化,但多个观测或可能事件所指的持久个体往往被隐式处理。我们提出将*单元*作为任务语义层面的显式基本要素。学习任务首先声明一个持久指称对象的总体及其同一性标准;实现的取值 u 标识所选指称对象。监督学习是主要的形式化特例。其语义对象是一族以单元条件化的响应定律。齐次性是这些定律重合的特殊情况;仅基于样本的条件对世界是齐次的还是观测定律仅为异质族的边际分布保持沉默。从数据中学习到的是一对 (T_φ, R_θ):一个产生上下文化单元标记的分词器,以及一个读取该标记的共享响应定律形式。结构化类将该形式定义为标记中的简单关系;线性预测器是其常见实例。标记是学习者侧的表示,通过它任务侧的单元影响预测,而忽略单元信息的学习者规范则对单元不敏感;齐次性仍是世界侧响应族的属性。当身份未解决时,世界侧定律混合了以单元条件化的目标,而学习者则将其共享形式与标记组合。可信的解析器可以固定单元并提供查找标记;否则*单元溯因*会从经验证据中形成相同类型的标记。未关联的单行观测可能无法区分异质单元世界与齐次汇总世界;可信的同一单元对则分离出受限见证。形式化结果涉及此监督特例。
## 1引言
标准监督学习形式化始于记录 D = {(x_i, y_i)}_{i=1}^N 和映射 f: X → Y [4, 17, 38]。索引 i 标识一条记录,而非该记录所指的个体。如果两条记录涉及同一个患者、用户、设备、生物体或其他持久个体,常规符号仅通过额外元数据或隐式建模约定来表示这种关系。这种省略对某些行级问题无害,但当事件共享一个个体、查询在该个体固定时发生变化、或事件到个体的归属不确定时,则会产生影响。它还留下一个更基本的问题未陈述:不同个体是否共享一个响应定律,或者观测到的行级定律是否汇总了不同的以单元条件化的关系。
持久个体并非统计或机器学习中的新概念。重复测量和随机效应模型通过提供的受试者或组别链接观测,并建模受试者特异性变异 [25, 13]。潜在结果框架比较同一实验单元的不同处理响应 [35]。推荐系统利用提供的用户ID来处理跨交互学习到的用户特定表示 [28, 24],而记录链接和实体解决则建模关于记录是否涉及同一底层实体的不确定性 [41]。每个传统都发展了丰富的局部理论及其特定假设和目标。这些传统共同指向一个共同的机器学习形式化,其语义顺序通常被隐式处理。一个任务首先声明一个持久指称对象的总体和同一性标准。然后声明附属于这些指称对象的学习对象和支持联合学习的跨单元结构。只有在这些选择之后,学习者的可访问性才变得相关:归属可以直接提供,也可以从证据中推断。我们将持久指称对象称为*单元*,并将其提升为学习问题的基本要素。
令 U: Ω → U, U ~ Π, U = u, u ∈ U, (1) 表示总体到个体的选择及其现实化。
#### 单元声明。
学习任务声明一个可能单元的总体、在何种标准下观测或可能的事件涉及同一持久指称对象、以及该关系保持的范围。现实化 U = u 标识该指称对象。定律 Π 描述总体选择;数据收集协议单独决定数据集归属的联合定律。单元声明先于任务特定的学习对象选择,其本身并不施加响应定律、损失、模型类或因果语义。本文的组织主张是*机器学习从噪声的、选择性观测的、单元关联事件中学到任务声明单元间的共享结构*。该基本要素陈述了什么持久存在以及哪些事件应归为一类。监督学习是主要的形式化特例:一个固定的单元选择整个以单元条件化的响应定律,u ⟼ [x ↦ P_u^⋆(dy | x)], (2) P_u^⋆(dy | x) := P^⋆(Y ∈ dy | X = x, U = u)。改变 x 查询同一响应曲面上的另一个位置;改变 u 选择该族中的另一个成员。一个不相关的映射族 {R_u} 对于有限数据来说过于灵活,包括对先前未见过的单元。因此,联合学习需要跨单元的共享约束,这在第 3.2 节中阐述:一个分词器产生一个上下文化的单元标记,一个共享的响应定律形式读取该标记。
任务声明:什么算作一个单元
总体陈述:U ~ Π → U = u
(a) 事件共享持久单元身份
事件1 (x_1, y_1) 单元 u_A 事件2 (x_2, y_2) 单元 u_B
事件3 (x_3, y_3)
(b) 同一单元选择一个响应定律
事件 i (x_i, y_i) 单元 u_A 响应定律 P_{u_A}^⋆(dy | x)
u_A 选择定律,而非事件
图 1:从单元声明到关联事件和响应定律。任务指定单元边界和同一性标准;U ~ Π 是总体陈述,U = u 是其现实化的单元。多个事件记录可归属到同一个 u,而同一指称对象索引一个世界侧的响应定律。固定 u 保留了指称对象,同时允许上下文和事件变化。
本文有三方面贡献。
1. 1\. 将单元形式化为任务声明的总体基本要素:样本记录一个事件,而任务首先声明事件所属的持久指称对象。
2. 2\. 提出一个共享形式接口(假设 1),其结构化类是标记中的简单关系,线性预测器是其常见实例(定义 2);学习对象是这对 (T_φ, R_θ)。
3. 3\. 分离了预言机预测价值、证据访问、学习者近似和单行不可能性边界,并针对行与单元权重、按记录与按单元不相交划分评估给出了推论。
## 2单元作为机器学习的基本要素
### 2.1样本、事件和任务声明的单元
对于下面发展的监督特例,一个带有真实归属的概念性完整数据表示为:
D_U^world = {(x_i, y_i, u_i)}_{i=1}^N, u_i ∈ U。 (3)
输入-响应对 (x_i, y_i) 是本特例中使用的事件内容。分号标记了该事件内容与 u_i 之间更一般的角色区分,u_i 标识事件被归属的个体。样本索引仅用于记录。特别是,
u_i = u_j ⟺ 事件 i 和 j 涉及同一个体, (4)
只要协议提供可靠的归属。相等性记录的是同一持久指称对象。预测等价性则较弱:两个不同的单元可能诱导相同的响应定律。
空间 U 是任务声明的,不必是数值型的。直接访问揭示三个对象:
k (可信键), u(k) (任务侧单元), Z_{u(k)}^c (学习者侧查找标记)。 (5)
映射 k ↦ u(k) 解析指称对象,查找提供标记,通过它 R_θ 在上下文 c 中读取它。在 ID 索引的模型中 Z_{u(k)}^c = z_θ(k), (6)
这是一个嵌入、偏好因子、随机效应或其他参数块,任何剩余的回答时变化被吸收到 c 中。其坐标是模型内部的,不必是唯一的;语义和推断区分总结在附录 B 中 [3]。
从归属到任务特定学习中一致携带的是解析的指称对象。所有归属到 u(k) 的记录读取或更新与该键关联的同一标记。因此,P_θ(dy | x, u) 在语义上表示一个由固定单元索引的学习响应定律;在计算上,它是在该单元标记 Z_u^c 上评估的共享形式 R_θ。在 ID 索引的模型中,它可能从 z_θ(k) 计算得出。当使用动态历史依赖的响应状态时,它属于分词器的上下文参数或响应模型,并且在指称对象保持固定时可能发生变化。
当单元归属或可信的指称解析器对学习者都不可见时,观测数据可能仅包含:
D^obs = {(x_i, y_i)}_{i=1}^N。 (7)
因此,公式 (3) 中的完整数据表示不同于带有学习者可见归属的观测:
D_U^obs = {(x_i, y_i, u_i)}_{i=1}^N, (8)
其中持久单元标签,或确定它们的可信解析器,对学习者是可用的。这种归属保证揭示了哪个指称对象和参数地址与事件相关;它并不使学习到的嵌入、随机效应或响应状态成为观测数据。
### 2.2固定单元并不固定事件
在监督学习中,来自公式 (2) 的固定单元响应定律 P_u^⋆(dy | x) 可能仍是随机的。固定 u 以同一个体为条件,同时允许重复测量、选择或结果不同。事件噪声、时变状态和其他外生变异在单元选择后仍可存在。因此,单元基本要素将“哪个个体?”与“该个体在此发生了什么?”分开,如图 1 所示。独立性、因果语义和确定性响应是单独的建模约定。具体的三事件插图有三个样本但只有两个单元:事件 1 和 3 共享 u_A,而它们的输入和现实化的响应仍是事件特定的。单元声明先于观测与因果语义之间的选择。因果估计量需要额外的约定;其中一个特例记录在附录 D 中。
直接单元访问和单元溯因为学习者侧获取同一任务声明单元提供了两种模式(第 4 节)。
## 3学习一族以单元条件化的响应定律
本文将监督学习发展为单元基本要素的主要形式化特例,因为通常的对象 P(dy | x) 使持久单元的后果尤为透明。归属在第 4 节单独处理。一旦单元被声明,语义对象就是公式 (2) 中的族 {P_u^⋆(dy | ·) : u ∈ U}。下一小节陈述学习者侧的分解:从单元到预测的每一条路径都经过一个上下文化的标记,所有单元使用一个响应定律形式 R_θ,学习者表示的每个单元特定差异都必须通过该标记。因此,监督问题不是特定架构如何编码 u,而是分词器能否组织单元特定的规律性,使得一个共享的 R_θ 足够简单以实现泛化。
概念上,固定的 u 选择一个在任务声明的完整响应输入 x 上的整个响应曲面。改变 x 移动到同一曲面上的另一个位置,而 u 保持固定。跨单元,依赖可能通过基线偏移 α(u)、改变的输入效应 β(u)、响应函数 f_u、结果噪声定律,或响应的支持集、阈值、排序偏好或查询敏感性进入。在假设 1 下,所有这些差异都由标记承载。拼接、注意力和调制可以实现分词器或更丰富的读出;下面的结构化类将读出 R_θ 定义为标记中的简单关系,线性预测器是其常见实例。
必须区分三层。如果单元被声明且对于几乎每个 u,P_u^⋆(dy | x) 都相同,则世界是普通监督学习的*齐次单元扩展*。另外,异质族可以在 U 上边际化产生相同的行级条件定律 P^⋆(dy | x)。在计算层,忽略单元的学习者规范对单元不敏感;常数标记或忽略其标记的响应形式是典型的实现。这种学习者侧限制和世界侧齐次层是不同的,因此仅凭行级符号和拟合无法在它们之间做出选择。命题 4 使这种模糊形式化,并给出一种观测协议,可以分离一对受限的世界;边界情况收集在附录 B 中。
### 3.1跨单元的响应异质性
第一个区分是改变单元是否会改变该条件关系。
###### 定义 1(单元响应齐次性与异质性)。
固定监督学习任务声明的完整响应输入。如果存在一个 Π-零集 N ⊆ U,使得...相似文章
UNIT: 释放大型语言模型在图持续学习中的潜力
本文提出UNIT框架,该框架在第一任务上微调大型语言模型以增强其在图持续学习中的适应性,解决了语义-结构分离和知识迁移不平衡的问题。实验表明其达到了最先进的性能。
时间序列即语言:面向通用时间序列基础模型的通用分词器
本文提出UniTok,一种将连续时间序列转化为离散标记的通用分词器,以及UniTok-FM,一个基于下一标记预测预训练的基础模型。该模型支持零样本和提示增强预测,以及通过无需训练的上下文推理实现少样本生成和分类——这是以往工作未能实现的能力。
表征作为机制可解释性的瓶颈:Manifestation Unit协议
本文介绍了Manifestation Units,这是一种类型化元组协议,用于将机制可解释性分析中的每个组件的统计量组织成结构化、可查询的字段。该协议在视觉(β-VAE、CNN)和语言(GPT-2)模型上进行了演示,展示了改进的检索和因果充分性。
统一多模态自回归建模:共享上下文-视觉分词器是实现统一的关键
UniAR提出了一个统一的自回归框架,使用单个离散视觉分词器桥接视觉理解与生成,在图像生成和编辑方面取得了最佳成果。
状态承诺学习:训练语言模型区分计算与记忆
本文介绍了状态承诺学习,这是一种训练目标,旨在教会语言模型区分临时计算令牌与持久状态令牌。作者提出了反事实擦除强化学习(CERL)和擦除依赖协议,在数学、逻辑、科学问答以及工具使用任务中展示了改进,且未牺牲准确性。