@jxmnop:我认为我们从来都不需要发明掩码语言建模。它在构造上就有点愚蠢。在大多数平行宇宙里,我们可能直接跳到自回归模型了,抱歉了 BERT
摘要
一条推文认为掩码语言建模没有必要,自回归模型就足够了,并顺便提到了 BERT。
我认为我们从来都不需要发明掩码语言建模。它在构造上就有点愚蠢。在大多数平行宇宙里,我们可能直接跳到自回归模型了,抱歉了 BERT
相似文章
Masked Diffusion Language Models 是强大且可操控的基于文本的世界模型,用于智能体强化学习 [R]
本文提出将 Masked Diffusion Language Models (MDLMs) 作为基于文本的世界模型用于智能体强化学习,表明其任意顺序去噪目标避免了前缀模式崩溃,并且相比自回归基线模型带来了更强的性能。
@_jasonwei: 当语言模型首次开始良好使用工具时,我曾同情那种认为无需扩大语言模型规模(lang…)的叙述。
作者认为,虽然工具使用使较小的语言模型能够有效执行任务,但较大的模型在速度、可靠性和内化知识方面仍然至关重要,强调在人工智能领域持续扩展规模的必要性。
基于自批判掩码语言模型的广告标题生成
提出了一种使用强化学习在掩码语言模型上生成电子商务广告标题的方法,性能优于基线模型和人工提交的标题。
掩码语言流模型
本文介绍了掩码语言流模型(MLFMs),该模型将掩码机制引入基于流的语言模型,从而实现连续流进行条件生成,并允许转换预训练的掩码扩散模型。作者提出了一种新型采样器,交替进行连续去噪和离散去掩码,首次证明了基于流的语言模型可以扩展至下游推理和指令遵循任务。
@maximelabonne: BERT 在约2020年变得如此火爆,以至于 @huggingface 在其文档中专门设置了 "BERTology" 页面。满满的怀旧感 …
对BERT在2020年重要影响的怀旧反思,Hugging Face将其记录为 'BERTology',并引发了对大语言模型构成的讨论。