HuggingFace

来自 HuggingFace 的文章

Cards List

使用 LFM2.5-VL-DSpark 加速视觉语言模型

Hugging Face Blog ↗ · 昨天 缓存

今天,我们为视觉语言模型 (VLM) LFM2.5-VL-3B 发布了一个实验性的 DSpark 草稿模型,它增加了一个推测解码路径,以实现更快的推理速度,同时内存成本最小。

0 人收藏 0 人点赞

RGBD20K:一个用于RGB-D语义分割的大规模基准

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了RGBD20K,这是一个用于RGB-D语义分割的大规模基准数据集,包含160个细粒度类别和20,000对图像,具有高质量注释和一种新颖的分数净化融合方法。

0 人收藏 0 人点赞

Transformer可以同时持有两个想法:LLMs中线性叠加的证据

Hugging Face Daily Papers ↗ · 昨天 缓存

本文证明LLMs中的Transformer在合并输入时表现出线性叠加,支持叠加线性假设,并提出一种引导解码方法以分离叠加输出。

0 人收藏 0 人点赞

AV-GRPO:基于模态锚定的解耦扩散强化学习,用于联合音视频生成

Hugging Face Daily Papers ↗ · 昨天 缓存

本文提出AV-GRPO,一个用于联合音视频生成的模态锚定强化学习框架,相比现有方法,提高了生成质量、语义对齐和跨模态同步性。

0 人收藏 0 人点赞

面向广义任务与运动规划问题的编码智能体

Hugging Face Daily Papers ↗ · 昨天 缓存

本文研究了用于自动化广义任务与运动规划的编码智能体,表明它们在模拟环境中以更高的成功率和效率优于传统方法。

0 人收藏 0 人点赞

直接询问Jev:基于校准决策的强化学习作为AI对齐故障的零样本检测器

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了RLCDAlignBench,一个用于评估Jev的基准测试。Jev是一个通过强化学习训练的校准决策模型,作为零样本检测器,针对十种AI对齐故障,具有高性能和成本效率。

0 人收藏 0 人点赞

Rufus-Air:一个开放的LLM后训练配方

Hugging Face Daily Papers ↗ · 昨天 缓存

Rufus-Air 是一个开放且可复现的LLM后训练配方,详细描述了一个八阶段的流程,从基础到高级增强能力,相比现有模型如GLM-4.5-Air-Base有所改进。

0 人收藏 0 人点赞

Qwen-Planner-Agent:一个用于真实世界移动规划智能体的AI-for-AI闭环框架

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了Qwen-Planner-Agent,一个用于移动规划智能体可扩展开发的AI-for-AI闭环框架,整合了数据生成、训练和部署,以提升在真实世界任务和基准测试中的性能。

0 人收藏 0 人点赞

基于随机Hessian估计的全参考图像质量指标率失真优化

Hugging Face Daily Papers ↗ · 昨天 缓存

本文提出了一种方法,通过使用随机Hessian估计将全参考图像质量指标近似为输入依赖的二次失真,将其集成到视频编解码器的率失真优化中,从而在VVC中实现BD率节省。

0 人收藏 0 人点赞

ExplorationBench:衡量AI系统在可验证外星世界中的探索能力

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了ExplorationBench,这是一个用于评估AI系统在可验证外星世界中探索能力的基准测试,通过提供可执行规则并防止从预训练数据中回忆,以应对科学发现中的挑战。

0 人收藏 0 人点赞

WanPE:面向现代文本到视频生成的电影级提示增强

Hugging Face Daily Papers ↗ · 昨天 缓存

WanPE是一个拥有3970亿参数的提示增强模型,用于提升文本到视频生成中的电影规划能力,显著提高了人类对原始提示的偏好,并与商业产品性能相竞争。

0 人收藏 0 人点赞

World Action Agent:通过世界动作预演利用VLMs进行机器人操作

Hugging Face Daily Papers ↗ · 昨天 缓存

本文提出了World Action Agent(WAA),一个多智能体系统,利用视觉语言模型(VLMs)通过具有接触视图、动作预演和视图内校正的视觉动作工作空间进行机器人操作,在基准测试中取得了最先进的结果。

0 人收藏 0 人点赞

PUBG Ally:作为AI队友的对话式具身智能体

Hugging Face Daily Papers ↗ · 昨天 缓存

本文介绍了PUBG Ally,一个在PUBG:BATTLEGROUNDS中充当语音启用队友的具身AI智能体,将语言模型推理与实时游戏控制相结合,实现互动游戏。

0 人收藏 0 人点赞

ViRDM:优化表示分布匹配用于少步因果视频生成

Hugging Face Daily Papers ↗ · 昨天 缓存

ViRDM是一种使用表示分布匹配的少步因果视频生成方法,通过在单GPU或多GPU上高效训练,取得了比基于DMD的基线更好的结果。

0 人收藏 0 人点赞

IterSynth: 重新审视基于角色解耦迭代合成的深度搜索代理

Hugging Face Daily Papers ↗ · 昨天 缓存

IterSynth介绍了一种针对深度搜索代理的角色解耦迭代合成范式,利用强化学习提高在长时搜索任务中的性能,并在基准测试中超越先前方法。

0 人收藏 0 人点赞

如何使用 NVIDIA Warp 和 MjWarp 加速机器人模拟和学习工作流

Hugging Face Blog ↗ · 2天前 缓存

本文解释了如何使用 NVIDIA Warp 和 MjWarp 在 GPU 上扩展机器人模拟,实现并行环境以加速学习工作流。

0 人收藏 0 人点赞

**识别谁在何时说话:使用 NVIDIA Nemotron 3 Diarization 构建实时、多说话人 AI**

Hugging Face Blog ↗ · 2天前 缓存

NVIDIA 发布了 Nemotron 3 Diarization,这是一个开源100M参数模型,实现了最先进的说话人识别,错误率为14.72%,支持最多八名说话人的实时和离线处理。

0 人收藏 0 人点赞

DeltaWAM: 双臂操作 Delta 世界行动模型

Hugging Face Daily Papers ↗ · 2天前 缓存

DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。

0 人收藏 0 人点赞

代理编辑世界模型 (AEWM):重新思考大语言模型代理的世界建模

Hugging Face Daily Papers ↗ · 2天前 缓存

本文提出代理编辑世界模型(AEWM),通过建模推理和动作如何塑造未来的任务进展来增强大语言代理,并在搜索和软件工程等多个领域的基准测试中实现了显著的性能提升。

0 人收藏 0 人点赞

训练世界模型中的物体恒存性

Hugging Face Daily Papers ↗ · 2天前 缓存

本文介绍了WROP,一个用于训练世界模型中物体恒存性的数据集,并评估了14个视频模型,发布了PWM-WROP,一个160亿参数的世界模型,在续作模型中排名靠前。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈