标签
作者分享了Leo/PSCLS的早期进展,这是一个实验性系统,能够学习序列间的关系,并在训练更多故事时改进其故事生成效果和指标。
Lophius 是一个新的混合代码/GUI 研究系统,用于语言模型,运行在笔记本中,旨在减少样板代码并简化模型检查、分词器分析和推理等任务。
本文介绍了 MameLoshnLM,这是首个开源的 8B 参数意第绪语语言模型,同时还包括 Oytser 预训练语料库和 Kashes 评估基准。研究表明,在高质量意第绪语数据上进行持续预训练的表现优于通用多语言模型,凸显了专门进行低资源语言建模的价值。
本文介绍了CGTime,一个4B参数的计算基础时间序列-语言模型,通过确定性统计和LLM言语化将感知与描述解耦,在多元理解任务上优于更大的通用模型。
WAR Enterprise发布了WARMIND-200M V2,一个203M参数的以葡萄牙语为先的因果语言模型,拥有公开权重并支持本地CPU推理,旨在作为验证其完整训练流程的研究检查点。
AntLingAGI 发布 Ling 3.0 flash,一个原生混合线性推理模型,总参数 124B,激活参数 5.1B,采用 MIT 许可证,声称以更少的计算量和更快的响应速度媲美 1T 参数的旗舰模型。
提出了Maglev,一种具有固定大小记忆的循环Transformer架构,它在训练期间保持可并行化的同时,推广了滑动窗口注意力。它使用预填充器和解码器,并采用记忆一致性损失,在验证损失和下游基准测试上优于基线。
This paper introduces AdaMTP, an adaptive training paradigm for multi-token prediction that dynamically aligns prediction horizons with sequence predictability using entropy-based segmentation, consistently outperforming standard MTP on math, code, and general benchmarks across three LLM backbones.
DiffusionGemma 是一个实验性的开放权重语言模型,通过离散扩散而非逐 token 解码来生成文本,从而实现极高速的生成。
Presents DLLM-TTS, a block discrete diffusion language model for text-to-speech synthesis that processes X-Codec2 tokens in blocks, enabling parallel generation with RTF 0.15 while achieving competitive quality with only 20K hours of training data.
AI9Stars 发布了 G9v3-39A5B,这是一个开放权重的 39B MoE 语言模型,拥有 5 个活跃专家,面向推理、编码和助手任务,采用 Apache 2.0 许可。
本文介绍了PARALLEL,一种受前额叶对齐强化启发、用于语言模型学习的方法。该方法决定对每个样本进行适配的时机和强度,使用独立的控制器信号来提高适配效率,同时保持高性能。
AURORA-LM 提出了一种连续潜空间扩散语言模型,将可解码的文本表示与分布建模分离,在 OpenWebText 和 XSum 上取得了强劲性能,并扩展到 1B 参数规模。
本文介绍了双锚定策略蒸馏(DAPD),这是一个用于解决语言模型在策略自蒸馏中特权幻觉问题的框架。DAPD 在多种任务上平均将 Qwen3-4B 提升 +2.00 分,且增益在更大规模上持续存在。
Smallest.ai 完成1300万美元A轮融资,用于开发小型专用语音模型,使AI智能体能够进行实时、类人的对话,旨在让语音交互与真人对话难以区分。
Introduces MORFES, a benchmark of 500 expert-verified items for testing productive inflectional competence in Modern Greek, and evaluates open language models including their own Sophea-Genesis-1, which leads on inflectional morphology.
MUGEN 提出了一个统一的运动-语言框架,避免了离散码本和迭代解码,使用带有连续潜变量槽位的单一自适应长度自编码器以及一次性生成,在 HumanML3D 和 SnapMoGen 基准上实现了高效、高质量的文本到运动与运动到文本性能。
Inkling-Small 是一款总参数 276B、活跃参数 12B 的模型,现已完全开放权重发布。在推理和智能体任务上,其性能与 Inkling 相当,而体积仅为后者的四分之一。
AntLing 3.0 flash、MiniMax M2.7 和 Step 3.7 flash 模型之间的比较,可能评估性能并识别真正的“flash”模型。
本文介绍了宪法中期训练(constitutional midtraining),即在大型语言模型的中期训练阶段插入基于价值观的内容,并表明与后训练方法相比,它能产生更持久的对齐增益,其益处即使在微调后仍然存在。该方法不会带来能力成本,并提高了对勒索及其他对齐压力的抵抗能力。