来自 HuggingFace 的文章
本文介绍了Lightning Weave,一个通过在线策略蒸馏将独立训练的推理能力组合成单一高效模型的框架,从而在数学和代码任务中提高准确率并减少令牌使用。
面向金融图表推理的E2A-Bench基准测试揭示,视觉语言模型常常无法维持可追溯的“证据到行动”可靠性,这凸显了评估完整推理链而非单一幻觉分数的必要性。
AlayaVista 是一种可控摄像头的流式视频世界模型,它将全景场景演化与透视视频合成解耦,并通过大规模的 MUGEN 数据集支持高保真交互式世界建模。
Yandex 发布了 AliceAI-Foundation-80B-A3B-Base,这是一种基础语言模型,采用混合架构和 MoE 层,拥有 800 亿参数(每个 token 激活 30 亿参数),从头开始训练,在俄语事实知识任务中表现出色。
SiliconBench评估了九款Apple Silicon上的LLM服务引擎,从速度、内存和保真度三个维度进行考察,发现显式内存预算并不能确保内存余量,且只有少数技术栈满足并发扩展和模型覆盖的所有标准。
论文介绍了StepAudio3Realtime,一个面向实时语音交互的音频语言基础模型,利用连续的听-说-想-行动循环结合Think-While-Speaking技术,以实现深度推理和低延迟,在MMSU和Full-Duplex Bench等基准测试中达到顶尖性能。
本文提出了 Convergent Emergence Hypothesis,指出少样本上下文学习在跨模态难度剖面上具有共同性,并通过六种模态的实验提供实证支持,显示其中五种模态存在相关性效应。
Realtime-Venus是一个主动全双工交互系统,通过两个独立训练的9B模型集成了持续感知、对话控制和原生语音生成,在音频和视频基准测试中取得高分。
Atria Dawn Preview 是来自 Shanghai AI Lab 的一款新型代理AI模型,基于744B参数MoE GLM-5.2基础构建,专为需要持续环境理解和工具使用的研究和工程任务设计。
本文详细介绍了为ComfyUI重新打包的YuE2模型,支持音频和音乐生成工作流。它提供了基于MERT-v2-FullSong和SheetSage2的模型文件,便于集成到ComfyUI项目中。
本文介绍了SteerDuplex,一个具有可控属性(如语气和个性)的全双工语音对话模型,并提出了SteerBench用于评估语音可控性,展示了使用强化学习相比基线的改进。
RelateAnything 是一个轻量级的实时开放词汇关系预测模型,它接受任意的谓词词汇和区域来源,在大型几何验证数据集上训练,并在新的跨数据集基准测试中进行评估,显示出比同类方法显著的性能提升。
StepAudio 3 Music 介绍了一个大规模、长篇音乐生成模型,通过 ABC-CoT 实现显式音乐规划,在音频质量和相似度指标上取得了高分,与其他系统相比表现优异。
本文详细介绍了Sophea的开发,这是一个生产级的双语希腊语-英语自动语音识别系统,通过迭代训练、数据过滤和模型集成来满足质量门槛并取得具有竞争力的基准测试结果。
Dynin-Robotics是一个多模态统一扩散模型,整合了视觉、语言和动作,用于语言条件下的机器人控制,通过联合去噪和测试时缩放提高适应性和成功率。
ZGCM-1是一个从头训练的7B开放基础模型,具有极高效率,结合内部推理和外部工具使用,用于数学和代理搜索任务,其性能与更大规模的模型如Qwen3-235B-A22B和GLM-5.1相当。
一个通用代理通过解读视觉证据、编写可执行程序,并基于物理反馈在多样化的操作任务中调整动作,直接控制物理机器人,无需针对特定任务的训练,便能实现高成功率。
StepAudio 3 Gen 是一个通用音频生成模型,它使用残差向量量化令牌,在一个单一的离散自回归框架内统一了文本转语音、声音设计、音效和音乐。
SAS 引入了一种门控稀疏注意力机制,该机制通过语言建模损失端到端优化上下文排序,在紧凑注意力预算下提升推理和长上下文任务的性能。