来自 HuggingFace 的文章
本文解释了如何使用 NVIDIA Warp 和 MjWarp 在 GPU 上扩展机器人模拟,实现并行环境以加速学习工作流。
NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。
天王星是一个面向具身智能的新一代仿真基础设施,它采用关节轨迹条件自回归扩散模型,能够以流式展开和可扩展控制的方式,实现可扩展、低延迟的机器人仿真生成。
本文介绍了一种剪枝Whisper ASR模型编码器层的方法,将编码器大小减少18.5%,并通过无标签数据蒸馏恢复性能,同时发布了代码和预训练模型供采用。
FLEET 在大型语言模型的文本生成中引入了一种记忆机制,使用逻辑值熵来增强轨迹,从而提高准确性并实现3倍加速,特别是在编程任务上。
StudentBench研究发现,人工智能辅导在GRE题目上的学习成效与人类辅导相当,其中一个人工智能导师以显著更低的成本取得了类似的结果。
本文介绍了 EmbodiedSWE,这是一个使用编码代理来解决复杂、长期的灵巧机器人任务,并通过模拟基准生成演示以训练机器人策略的框架。
本文介绍了即时记忆(JitMem),一种为LLM代理设计的方法,它将记忆策展推迟到读取时以实现任务自适应负载,展示了在ALFWorld和WebShop等基准测试中相对于基线方法的显著性能提升。
本文介绍了RecCAR,一种正则化方法,用于解决联合多模态扩散变换器中的互惠对应差距,从而提高视频生成任务的性能。
InternW0是来自Shanghai AI Laboratory的基础物理世界模型,联合学习视觉动态与机器人控制以实现高效的真实世界交互,在异质数据上训练,并在科学任务上进行评估。
WhatWorkedBench是一个基准测试,旨在通过评估AI代理在各种任务和配置中进行预算实验后预测结果的准确性来衡量其对实验的理解。
本文介绍了VHD-Play,一个通过首先解决数学模型来生成多样化智能体强化学习环境的流程,显著提高了像Qwen3.6-35B-A3B这样的语言模型代理的训练效率,且成本低廉,并扩展到外部基准测试。
Hunyuan-A13B 是一个开源的大型语言模型,采用专家混合架构,在推理时激活 130 亿参数,并具备双模式思维链框架,以实现对复杂任务的自适应推理。
MemBodied 引入了一种具有联想状态和情节锚点的固定大小情景记忆,旨在增强视觉-语言-动作模型在历史依赖型操作任务中的能力,并显著超越了基线方法的性能。
本文介绍了GeoPair,一个用于Transformer压缩的免训练框架,它在保持激活几何结构的同时优化跨层分解,实现了跨多样架构的最新结果。
HARMONY是一个开源框架,利用分层代理推理和VLMs从单张室内图像重建组合式3D场景,在视觉质量上与GPT-6 Astra竞争,并在几何对齐上表现更优。
该论文为大型语言模型强化学习中的令牌级信用制定了正则条件,并介绍了策略对齐评论家训练(PACT),该方法在数学推理和编码基准测试中优于GRPO和PPO。