HuggingFace

来自 HuggingFace 的文章

Cards List

TutorMoments:AI导师知道何时该帮助、何时该收手吗?

Hugging Face Blog · 昨天 缓存

Ai2推出了TutorMoments,一个基于回放的评估框架和数据集,用于衡量大语言模型在1对1数学辅导中能否平衡何时提供帮助与何时放手。初步结果显示,模型倾向于过度帮助,而提示工程只能部分缩小与人类导师的差距。

0 人收藏 0 人点赞

Kijai/MiniMax-H3_comfy

Hugging Face Models Trending · 昨天 缓存

一个Hugging Face仓库,托管了为ComfyUI使用而转换的MiniMax-H3模型,以及用于加快推理的Lightx2v蒸馏LoRA。

0 人收藏 0 人点赞

lightx2v/Minimax-h3-Turbo

Hugging Face Models Trending · 昨天 缓存

面向 Minimax-h3-Turbo 视频生成模型的 Hugging Face 页面,提供通过 Diffusers 及 Colab/Kaggle 笔记本使用该模型的说明。

0 人收藏 0 人点赞

drbaph/MiniMax-H3-Turbo-Lora-ComfyUI

Hugging Face Models Trending · 2天前 缓存

MiniMax-H3 Turbo 4步音频-视频生成的第三方ComfyUI兼容LoRA转换,包含进一步训练的checkpoint-500变体及示例工作流。

0 人收藏 0 人点赞

KVAE:用于多模态生成模型的系列分词器

Hugging Face Daily Papers · 3天前 缓存

本文介绍了KVAE,这是一个专为文本条件生成模型设计的音频、图像和视频分词器系列。论文声称,与现有开源分词器相比,KVAE在重建质量和生成质量上具有竞争力或更优。代码和训练细节已公开发布。

0 人收藏 0 人点赞

EffectLearner:面向真实世界视频物体移除的世界感知物体-效果推理

Hugging Face Daily Papers · 3天前 缓存

EffectLearner 是一个面向真实世界视频物体移除的语义推理增强框架,它将基于 VLM 的物体-效果推理器与基于 DiT 的视频擦除器相结合,并引入了 EffectWorld 数据集以处理复杂的物体引发效果。

0 人收藏 0 人点赞

MASS:具有权威共享状态的多玩家世界模型

Hugging Face Daily Papers · 3天前 缓存

本文介绍了MASS,一种多玩家世界模型方法,通过使用权威共享状态将世界动态与视图渲染解耦,从而实现可扩展且一致的多智能体模拟,支持多达1,024个并发玩家。

0 人收藏 0 人点赞

从经济智能体到智能体经济:经济世界模型的系统蓝图

Hugging Face Daily Papers · 3天前 缓存

本文提出了一个系统蓝图和六级能力阶梯,用于构建经济世界模型(EWMs),其中异构智能体与市场和制度互动,以产生涌现的经济动态。本文综述了现有工作,并强调了自进化智能体、内生制度与实证对齐方面的空白。

0 人收藏 0 人点赞

转型中的持续学习

Hugging Face Daily Papers · 3天前 缓存

本文综述了持续学习从参数中心方法向系统级适应的演变,提出了一个三轴框架(何时、如何、何地)来刻画预训练、后训练和推理阶段的学习。

0 人收藏 0 人点赞

DyPES-VLA:面向跨具身操作的学习共享动力学先验与具身特定控制

Hugging Face Daily Papers · 3天前 缓存

DyPES-VLA是一种跨具身VLA模型,通过未来预测学习共享动力学先验,并使用具身特定的混合专家(MoE)动作头在机器人原生动作空间中控制机器人,在LIBERO、RoboCasa和RoboTwin基准上取得了最先进的结果。

0 人收藏 0 人点赞

HarnessOpt-Bench:评估LLM在Harness优化中的表现

Hugging Face Daily Papers · 3天前 缓存

HarnessOpt-Bench是一个基准测试,用于评估LLM在固定评估预算下优化目标智能体周围harness(提示、工具、控制流、记忆和编排代码)的能力。对五个前沿LLM的实验表明,优化器模型之间的差异大于它们所借助的编码harness之间的差异,且仍有很大的改进空间。

0 人收藏 0 人点赞

ChronoVision:通过潜在状态重建进行时间推理

Hugging Face Daily Papers · 3天前 缓存

ChronoVision 是一个多模态框架,通过将视觉逻辑与潜在图像对齐,使用重构视觉头、ROI 注意力定位模块和强化学习,改进视觉语言模型中的时间推理。它引入了 Vbvr-VQA 数据集,并在时间跟踪基准上达到了 SOTA 准确率。

0 人收藏 0 人点赞

从失败中学习:基于硬负样本的检索中心思维链用于统一多模态检索

Hugging Face Daily Papers · 3天前 缓存

本文提出了UniME-R1,一种用于统一多模态检索的嵌入器-顾问框架,该框架基于检索反馈生成检索中心思维链(RC-CoT),通过从硬负样本中学习来提升检索性能。

0 人收藏 0 人点赞

面向多语言数学推理的同策略Delta蒸馏

Hugging Face Daily Papers · 3天前 缓存

本文研究了同策略Delta蒸馏(OPD^2)在英语、韩语和日语中的多语言数学推理,显示其相对于标准OPD的一致改进,并缩小了语言差距。

0 人收藏 0 人点赞

GST-Bench:VLMs能否从视频中形成全局空间意识?

Hugging Face Daily Papers · 3天前 缓存

GST-Bench是一个新的VQA基准,用于评估视频理解中的全局空间意识,测试VLMs能否从长时间的第一人称视频中构建连贯的全局场景表示。对22个最先进的VLMs的评估显示,它们与人类之间存在巨大差距,最佳模型得分42.68,而人类为79.08。

0 人收藏 0 人点赞

AgentOPSD:智能体强化学习中的递归自蒸馏

Hugging Face Daily Papers · 3天前 缓存

AgentOPSD 提出了一种无评论家的递归方法,用于智能体强化学习中的回合级信用分配,通过在 log-odds 空间中进行贝叶斯信念更新来重新加权结果。它在 ALFWorld 上使用 Qwen2.5-7B 达到了 89.1% 的成功率,优于 GRPO 和自蒸馏基线。

0 人收藏 0 人点赞

CalibForge:面向可学习终端任务扩展的对抗性求解器校准

Hugging Face Daily Papers · 3天前 缓存

CalibForge 是一个自主终端任务合成系统,利用对抗性求解器校准来生成可学习任务,用于训练终端智能体。它构建了 5,431 个校准任务,并在 Terminal-Bench2.0、SWE-bench Pro 和 Doc2Repo 上提升了智能体性能。

0 人收藏 0 人点赞

EnvACE:通过世界预演内化环境动态以实现智能体强化学习

Hugging Face Daily Papers · 3天前 缓存

EnvACE 引入了世界预演,一种智能体强化学习方法,通过策略在内部预演环境响应来取代外部环境交互,在多个基准上取得了强劲性能。

0 人收藏 0 人点赞

PaDoc: 基于布局的并行解码用于文档解析

Hugging Face Daily Papers · 3天前 缓存

PaDoc 提出了一种面向端到端文档解析器的基于布局的并行解码方法,将布局解码与内容解码解耦,以减少解码深度并提高吞吐量。它在 OmniDocBenchFull 上取得了最先进的结果,并且相比顺序基线显著加速了推理。

0 人收藏 0 人点赞

Baseten 现已上线 Hugging Face 推理提供方 🔥

Hugging Face Blog · 3天前 缓存

Hugging Face 宣布将 Baseten 作为受支持的推理提供方,使用户能够直接从模型页面和 SDK 以无服务器方式访问 Kimi K3、DeepSeek V4 Flash 和 GLM-5.2 等热门开源权重大语言模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈