来自 HuggingFace 的文章
今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。
本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。
本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。
本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。
本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。
Rufus-Air 是一个开放且可复现的LLM后训练配方,详细描述了一个八阶段的流程,从基础到高级增强能力,相比现有模型如GLM-4.5-Air-Base有所改进。
本文介绍了Qwen-Planner-Agent,一个用于移动规划智能体可扩展开发的AI-for-AI闭环框架,整合了数据生成、训练和部署,以提升在真实世界任务和基准测试中的性能。
本文提出了一种方法,通过使用随机Hessian估计将全参考图像质量指标近似为输入依赖的二次失真,将其集成到视频编解码器的率失真优化中,从而在VVC中实现BD率节省。
本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。
WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。
本文提出了World Action Agent(WAA),一个多智能体系统,利用视觉语言模型(VLMs)通过具有接触视图、动作预演和视图内校正的视觉动作工作空间进行机器人操作,在基准测试中取得了最先进的结果。
本文介绍了PUBG Ally,一个在PUBG:BATTLEGROUNDS中充当语音启用队友的具身AI智能体,将语言模型推理与实时游戏控制相结合,实现互动游戏。
ViRDM是一种使用表示分布匹配的少步因果视频生成方法,通过在单GPU或多GPU上高效训练,取得了比基于DMD的基线更好的结果。
IterSynth介绍了一种针对深度搜索代理的角色解耦迭代合成范式,利用强化学习提高在长时搜索任务中的性能,并在基准测试中超越先前方法。
本文解释了如何使用 NVIDIA Warp 和 MjWarp 在 GPU 上扩展机器人模拟,实现并行环境以加速学习工作流。
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。
本文提出代理编辑世界模型(AEWM),通过建模推理和动作如何塑造未来的任务进展来增强大语言代理,并在搜索和软件工程等多个领域的基准测试中实现了显著的性能提升。
本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。