迈向十亿级容量用户表示学习的稠密化定律

Hugging Face Daily Papers 论文

摘要

本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。

在实际工业场景中,用户表示学习通常通过增加用户数量、行为序列长度和模型规模来扩展。然而,现有方法面临两个挑战:(i)在十亿级容量下原始数据扩展的瓶颈,因为随着原始文本用户行为输入规模增大,性能增益递减,这可以通过分词来缓解。(ii)缺乏关于分词配置如何随数据规模扩展的定量分析。在本报告中,我们提出了用户行为稠密化定律,用于表征数据规模与最小充分分词容量之间的定量关系。首先,我们在十亿级Alipay数据集上进行了原始与分词扩展对比的初步研究,揭示了原始数据扩展瓶颈和分词带来的持续增益。为了推导控制不同数据规模下最小充分分词配置的扩展模式,我们采用理论分析和系统实验来总结定量扩展模式。我们发现最小充分分词容量的对数与以分词计的输入数据规模之间存在近似线性关系,且扩展斜率随分词方法和数据源系统性地变化,反映了表示空间冗余度和源内独特性的差异。在所提出定律的指导下,我们进一步开发了ALGN,一种自适应可变长度分词方法,以改善容量分配。在各种数据源、分词方法和下游任务上的大量实验证明了用户行为稠密化定律的普遍性和可靠性,为大规模用户表示学习中的分词配置选择提供了实用指导。此外,ALGN优于现有基线方法。
查看原文
查看缓存全文

缓存时间: 2026/08/25 12:36

论文页面 - 面向千亿级容量的用户表征学习稠密化定律

来源:https://huggingface.co/papers/2608.23392

摘要

本研究提出一种链接数据规模与令牌化容量的缩放定律,用于用户行为建模,并引入自适应令牌化方法以提升效率。

现实工业场景中的用户表征学习(https://huggingface.co/papers?q=User%20representation%20learning)通常通过增加用户数量、行为序列长度和模型规模来进行扩展。然而现有方法面临两大挑战:(一)千亿级容量下原始数据扩展的瓶颈——随着原始文本用户行为输入规模增大,性能收益呈现递减趋势,而令牌化(https://huggingface.co/papers?q=tokenization)可缓解此问题;(二)缺乏关于令牌化配置如何随数据规模进行量化扩展的系统分析。本报告提出用户行为稠密化定律(https://huggingface.co/papers?q=User%20Behavioral%20Densing%20Law),用于刻画数据规模与最小充分令牌化容量(https://huggingface.co/papers?q=tokenization)之间的定量关系。首先在支付宝千亿级数据集上对原始扩展与令牌化扩展进行对比实验,揭示原始数据扩展瓶颈及令牌化带来的持续增益。通过理论分析与系统实验总结出支配不同数据规模下最小充分令牌化配置的缩放模式,发现最小充分令牌化容量与令牌度量的输入数据规模对数之间存在近似线性关系,且缩放斜率随令牌化方法与数据源系统性变化,反映了表征空间冗余度与源内独特性的差异。基于该定律,我们进一步开发了ALGN(https://huggingface.co/papers?q=ALGN)——一种优化容量分配的自适应变长令牌化(https://huggingface.co/papers?q=adaptive%20variable-length%20tokenization)方法。跨多数据源、令牌化方法和下游任务的大量实验验证了用户行为稠密化定律的普适性与可靠性,为大规模用户表征学习中的令牌化配置选择提供实用指导。实验同时表明ALGN性能优于现有基线方法。

查看arXiv页面 (https://arxiv.org/abs/2608.23392) 查看PDF (https://arxiv.org/pdf/2608.23392) GitHub仓库 (https://github.com/David-Dou/find-densing-law) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23392)

通过智能助手获取本文: hf papers read 2608\.23392

尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用本文的模型(0篇)

无模型关联本文 在模型README.md中引用arxiv.org/abs/2608.23392以建立关联。

引用本文的数据集(0篇)

无数据集关联本文 在数据集README.md中引用arxiv.org/abs/2608.23392以建立关联。

引用本文的Space(0篇)

无Space关联本文 在Space README.md中引用arxiv.org/abs/2608.23392以建立关联。

收录本文的合集(0篇)

无合集收录本文 将本文添加到合集 (https://huggingface.co/new-collection) 以建立关联。

相似文章

Compute Optimal Tokenization (2分钟阅读)

TLDR AI

本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。