标签
本文研究了语言模型在27种语言中是否对替代(非规范)分词保持鲁棒性,发现英语中观察到的不变性并不具有普适性,且分词碎片化程度更高的语言表现出更高的敏感性。作者证明,使用多分词数据的LoRA微调可以有效缓解这种敏感性。
本文提出JOLT,一种整数规划方法,用于优化基于从左到右贪心最长匹配解码(WordPiece)的子词分词。JOLT实现了近乎最优的压缩,缩小了BPE与理论下界之间的大部分差距,使token数量相比BPE最多减少0.78%。
本文介绍了BHARATI,一组基于SentencePiece BPE的分词器,在针对古典印度语言的平衡多语语料库上训练而成。子词丰富度分析显示,分词效率显著提升,与基线分词器相比,序列长度最多缩短90%,从而提高了下游语言模型的有效上下文长度。
巴西农民在B3证券交易所将10头奶牛代币化,筹集了近2万美元的牲畜担保信贷,使用AI智能追踪项圈防止欺诈并实现动产抵押。
GigaToken 是一个超快速的分词器库,声称比 HuggingFace 分词器快达 1000 倍,支持大多数常见的大语言模型分词器,并提供即插即用的兼容性。
Liquid AI 分享了原地升级预训练模型分词器的秘诀,将 LFM2.5 的分词器从 65K 扩展到 128K,以提高对泰语、越南语和印地语等语言的效率,结果使得令牌数量减少多达4倍,生成速度提升2.2-3.7倍。
本文研究了多语言分词器如何处理跨语言同形词(不同语言中拼写相同但含义不同的词),并提出了一种轻量级的语言线索干预方法,通过引入语言特定字符来减少分词共享。实验表明,在机器翻译中,特别是在BPE分词下,该方法带来了适度的改进。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
蚂蚁数字科技在Real Up戛纳峰会上推出了新的Web3+AI品牌Anvita,旨在构建代理到代理(A2A)数字经济的基础设施,其中包含用于自主代理协作的Anvita Flow和用于代币化即服务的Anvita TaaS。
这篇博文开启了一个系列,介绍如何在Python中构建APL解释器,涵盖对包含数字、函数和运算符的基本APL表达式进行分词和解析。
本文系统比较了化学SMILES字符串的BPE和Unigram-LM分词方法,发现它们产生了几乎不相交的词汇表,并且在分割粒度上存在显著差异。结果表明,子词算法的选择是一个关键的建模决策,而不是一个免费的默认选项。
本文提出了一种说话人解耦的音节标记器,通过对扰动学生表示向干净教师目标进行回归,实现了最先进的音节边界检测,并在语音语言模型理解上相对于SpiRit-LM取得了7%的相对提升。
Victoria Lin's Stanford CS25 lecture discusses the paradigm shift from language models to native multimodal intelligence, covering tokenization approaches and comparing models like Chameleon and Transfusion.
AVTok提出了一种用于音视频生成的统一一维标记器,采用双流Transformer架构,具有共享编码器-解码器和模态特定查询,实现了紧凑的潜在表示,在重建和下游生成任务中表现出色。
BrainJanus是首个统一的大脑模型,通过共享的Omni空间整合大脑、视觉与语言,利用分词表征和自回归下一个token预测实现神经活动与感官刺激的双向映射。
本文提出了一种前馈框架,能够从无位姿的多视图图像中将3D场景分解为实例结构的令牌组,从而在没有3D标注的情况下实现直接的对象级重建、分割和操控。
本文系统量化了20种非洲语言在11个前沿和开源分词器上的分词惩罚,发现推理成本和延迟最高可达8.9倍,有效上下文窗口仅为英语的11%,突显了子词词汇表中编码的结构性数字鸿沟。
本文系统研究了Twitter数据情感分析预处理技术的最佳顺序,发现分词影响最大,拼写纠正影响最小,最佳顺序为:分词、清洗、词干提取、停用词去除。
本文介绍了QuechuaTok,一个用于评估南克丘亚语分词策略的基准,并引入了形态边界准确率(MorphAcc)作为必要指标。结果表明,BPE实现了低碎片率但形态准确性差,而基于形态感知的PRPE分词器达到了83%的MorphAcc,表明仅凭碎片率不足以评估黏着型语言的分词器。
本文在统一的transformer框架内,比较了四种分词方法(Affine、AIM、JetFormer、VQ-VAE)用于天文图像,使用64万张星系图像评估重构质量、物理属性预测和形态保持能力。研究发现,没有单一方法在所有任务中表现最佳,突显了表示学习中的权衡。