标签
介绍了ELMER,一种进化语言模型,它搜索自然语言策略描述并将其编译成可执行程序,使用经直接偏好优化微调的Qwen3-8B来控制变异强度并提高搜索效率。
本文研究了在掩码扩散语言模型中,无分类器引导(CFG)在何种情况下真正必要。研究表明,对引导的依赖因提示而异,且通常可以在不损失约束满足能力的前提下移除引导,并由此定义了“承诺视界”(commitment horizon)。
An annotated from-scratch reimplementation of Google's DiffusionGemma, a 26B open-weight state diffusion language model, explaining its architecture, sampling procedure, and design choices.
作者分享了Leo/PSCLS的早期进展,这是一个实验性系统,能够学习序列间的关系,并在训练更多故事时改进其故事生成效果和指标。
Lophius 是一个新的混合代码/GUI 研究系统,用于语言模型,运行在笔记本中,旨在减少样板代码并简化模型检查、分词器分析和推理等任务。
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
本文介绍了CGTime,一个4B参数的计算基础时间序列-语言模型,通过确定性统计和LLM言语化将感知与描述解耦,在多元理解任务上优于更大的通用模型。
WAR Enterprise发布了WARMIND-200M V2,一个203M参数的以葡萄牙语为先的因果语言模型,拥有公开权重并支持本地CPU推理,旨在作为验证其完整训练流程的研究检查点。
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。
提出了Maglev,一种具有固定大小记忆的循环Transformer架构,它在训练期间保持可并行化的同时,推广了滑动窗口注意力。它使用预填充器和解码器,并采用记忆一致性损失,在验证损失和下游基准测试上优于基线。
This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.
DiffusionGemma 是一个实验性的开放权重语言模型,通过离散扩散而非逐 token 解码来生成文本,从而实现极高速的生成。
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
AI9Stars 发布了 G9v3-39A5B,这是一个开放权重的 39B MoE 语言模型,拥有 5 个活跃专家,面向推理、编码和助手任务,采用 Apache 2.0 许可。
本文介绍了PARALLEL,一种受前额叶对齐强化启发、用于语言模型学习的方法。该方法决定对每个样本进行适配的时机和强度,使用独立的控制器信号来提高适配效率,同时保持高性能。
AURORA-LM 提出了一种连续潜空间扩散语言模型,将可解码的文本表示与分布建模分离,在 OpenWebText 和 XSum 上取得了强劲性能,并扩展到 1B 参数规模。
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
Smallest.ai 完成1300万美元A轮融资,用于开发小型专用语音模型,使AI智能体能够进行实时、类人的对话,旨在让语音交互与真人对话难以区分。
Introduces MORFES, a benchmark of 500 expert-verified items for testing productive inflectional competence in Modern Greek, and evaluates open language models including their own Sophea-Genesis-1, which leads on inflectional morphology.