迈向十亿级容量用户表示学习的稠密化定律
摘要
本文提出了一种用户表示学习的稠密化定律,量化了数据规模与分词容量之间的关系,并引入了一种自适应分词方法ALGN,以提高十亿级场景的效率。
查看缓存全文
缓存时间: 2026/08/25 12:36
论文页面 - 面向千亿级容量的用户表征学习稠密化定律
来源:https://huggingface.co/papers/2608.23392
摘要
本研究提出一种链接数据规模与令牌化容量的缩放定律,用于用户行为建模,并引入自适应令牌化方法以提升效率。
现实工业场景中的用户表征学习(https://huggingface.co/papers?q=User%20representation%20learning)通常通过增加用户数量、行为序列长度和模型规模来进行扩展。然而现有方法面临两大挑战:(一)千亿级容量下原始数据扩展的瓶颈——随着原始文本用户行为输入规模增大,性能收益呈现递减趋势,而令牌化(https://huggingface.co/papers?q=tokenization)可缓解此问题;(二)缺乏关于令牌化配置如何随数据规模进行量化扩展的系统分析。本报告提出用户行为稠密化定律(https://huggingface.co/papers?q=User%20Behavioral%20Densing%20Law),用于刻画数据规模与最小充分令牌化容量(https://huggingface.co/papers?q=tokenization)之间的定量关系。首先在支付宝千亿级数据集上对原始扩展与令牌化扩展进行对比实验,揭示原始数据扩展瓶颈及令牌化带来的持续增益。通过理论分析与系统实验总结出支配不同数据规模下最小充分令牌化配置的缩放模式,发现最小充分令牌化容量与令牌度量的输入数据规模对数之间存在近似线性关系,且缩放斜率随令牌化方法与数据源系统性变化,反映了表征空间冗余度与源内独特性的差异。基于该定律,我们进一步开发了ALGN(https://huggingface.co/papers?q=ALGN)——一种优化容量分配的自适应变长令牌化(https://huggingface.co/papers?q=adaptive%20variable-length%20tokenization)方法。跨多数据源、令牌化方法和下游任务的大量实验验证了用户行为稠密化定律的普适性与可靠性,为大规模用户表征学习中的令牌化配置选择提供实用指导。实验同时表明ALGN性能优于现有基线方法。
查看arXiv页面 (https://arxiv.org/abs/2608.23392) 查看PDF (https://arxiv.org/pdf/2608.23392) GitHub仓库 (https://github.com/David-Dou/find-densing-law) 添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2608.23392)
通过智能助手获取本文:
hf papers read 2608\.23392
尚未安装最新CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本文的模型(0篇)
无模型关联本文 在模型README.md中引用arxiv.org/abs/2608.23392以建立关联。
引用本文的数据集(0篇)
无数据集关联本文 在数据集README.md中引用arxiv.org/abs/2608.23392以建立关联。
引用本文的Space(0篇)
无Space关联本文 在Space README.md中引用arxiv.org/abs/2608.23392以建立关联。
收录本文的合集(0篇)
无合集收录本文 将本文添加到合集 (https://huggingface.co/new-collection) 以建立关联。
相似文章
ScaleToT: 泛化结构化LLM推理以用于十亿级低活跃用户建模
ScaleToT提出了一种方法,旨在将结构化LLM推理泛化到十亿级低活跃用户建模中,通过思维树(ToT)精炼和训练学生模型来降低成本。在广告部署中的在线A/B测试显示,LT30提升了6.738%。
Compute Optimal Tokenization (2分钟阅读)
本文通过训练近1300个模型,系统推导了压缩感知的神经缩放定律,证明了广泛使用的每参数20个词元的启发式方法是由特定分词器造成的。作者提出了基于字节的分词器无关缩放定律,为跨多样语言和模态的计算高效训练提供了新框架。
如何分配你的Token?训练步数与批次大小的缩放定律
提出了一种三项缩放定律,将模型大小、训练步数和批次大小解耦,使得用更少的运行次数即可进行稳健拟合,并推导出次优批次大小的缩放定律。
InfoLaw:基于质量加权混合数据与重复度的大型语言模型信息缩放定律
InfoLaw 是一种数据感知型缩放框架,能够根据 token 消耗量、模型规模、数据混合权重及重复度预测模型损失,从而在不同算力预算下实现高效的数据配方选择。
@rosinality: https://arxiv.org/abs/2606.29858 为什么会出现幂律缩放?单个token的损失遵循S形曲线,……
本文提出了一个token级别的框架,表明语言模型损失中的幂律缩放来源于单个token的S形学习曲线的聚合,并证明根据token学习时间重塑训练分布可以将验证损失降低11%。