HuggingFace

来自 HuggingFace 的文章

Cards List

MintAct: 数字环境的统一视觉代理

Hugging Face Daily Papers · 6天前 缓存

MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。

0 人收藏 0 人点赞

OmniVBench:一个用于全能参考视频生成的基准和大规模数据集

Hugging Face Daily Papers · 6天前 缓存

本文介绍了OmniVBench,一个用于全能参考视频生成的综合基准,以及Omni-R2VDataset,一个大规模训练数据集,以评估和改进R2V模型。

0 人收藏 0 人点赞

RecreationWorld: 可扩展且可验证的混合计算机使用代理环境

Hugging Face Daily Papers · 6天前 缓存

RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。

0 人收藏 0 人点赞

GraphSkillEvo:图结构代理技能的进化优化

Hugging Face Daily Papers · 6天前 缓存

GraphSkillEvo是一个进化优化框架,它将代理技能表示为图结构工件,以提高大型语言模型(LLM)的性能,在多个基准测试中超越基线。

0 人收藏 0 人点赞

CodeMidas:从代码本身扩展智能编程强化学习环境

Hugging Face Daily Papers · 6天前 缓存

CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。

0 人收藏 0 人点赞

分解式AI评估中的预测驱动平滑与验证

Hugging Face Daily Papers · 2026-09-17 缓存

该论文提出了用于分解式AI评估的预测驱动平滑和验证方法,提高了在标记数据有限的领域中点估计和区间估计的准确性。

0 人收藏 0 人点赞

精炼本质上是可编辑的:基于生成精炼网络的免训练提示到提示图像编辑

Hugging Face Daily Papers · 2026-09-17 缓存

RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。

0 人收藏 0 人点赞

针对干细胞显微镜的Cellpose-SAM保留约束训练后量化

Hugging Face Daily Papers · 2026-09-17 缓存

本文评估了Cellpose-SAM在干细胞显微镜中的压缩方案,表明混合精度量化在保持分割精度的同时实现了6.76倍的压缩且无灾难性失败。

0 人收藏 0 人点赞

Paint-Anything: 用于图像生成与编辑的统一全色控制

Hugging Face Daily Papers · 2026-09-17 缓存

Paint-Anything介绍了一种统一的十六进制提示接口,用于图像生成与编辑的颜色控制。该接口在自定义数据集上训练,并通过新基准测试评估,表明在色彩保真度方面有显著提升。

0 人收藏 0 人点赞

基于信息瓶颈的训练自适应卷积稀疏编码用于鲁棒视觉表示

Hugging Face Daily Papers · 2026-09-17 缓存

本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。

0 人收藏 0 人点赞

TeleAntiFraud 2.0:一个可刷新的、基于档案且基于音频的电信欺诈检测基准

Hugging Face Daily Papers · 2026-09-17 缓存

本文介绍了TeleAntiFraud 2.0,这是一个基于音频的基准,用于评估电信欺诈检测模型,采用混合树生成流水线和每月冻结集,以应对不断演变的欺诈脚本和近域负样本。

0 人收藏 0 人点赞

无显式轨迹下3D扩散策略的预见性学习

Hugging Face Daily Papers · 2026-09-17 缓存

引入Movement Trend Guidance以增强机器人操作中的3D扩散策略,通过无显式轨迹提供预见性,在RoboTwin2.0和LIBERO-40等基准测试上实现性能提升。

0 人收藏 0 人点赞

当AI评审训练AI评审者:科学判断崩溃与缓解

Hugging Face Daily Papers · 2026-09-17 缓存

本研究探讨了AI生成的评审影响未来AI评审者训练的反馈循环,导致判断多样性降低,这种现象称为'科学判断崩溃'。同时介绍了TrustReviewer,这是一个开源系统,通过精选训练和激活引导来缓解这一问题。

0 人收藏 0 人点赞

DeformSmith:物理引导分层生成用于机器人操作的可变形资产

Hugging Face Daily Papers · 2026-09-17 缓存

DeformSmith是一个框架,用于从文本或图像生成交互式、物理可信的可变形资产,通过物理引导的分层生成来提高质量和可信度。

0 人收藏 0 人点赞

自我进化搜索索引

Hugging Face Daily Papers · 2026-09-17 缓存

本文介绍了SELF-INDEX,这是一个使搜索索引能够自主自我进化的框架,从而提升检索性能,并惠及搜索代理和代理记忆系统等下游应用。

0 人收藏 0 人点赞

当EOS Token产生分歧:理解在策略蒸馏中的长度膨胀现象

Hugging Face Daily Papers · 2026-09-17 缓存

本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。

0 人收藏 0 人点赞

FAMOS:基于稀疏观测的前馈三维关节建模

Hugging Face Daily Papers · 2026-09-17 缓存

FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。

0 人收藏 0 人点赞

不要掩盖环境:观察监督改变智能体在强化学习下的探索方式

Hugging Face Daily Papers · 2026-09-17 缓存

本文介绍了ActObs,一种监督智能体轨迹中动作和观察标记的方法,以改善强化学习探索,并在Terminal-Bench2.0和aider-polyglot等基准测试中展示了性能提升。

0 人收藏 0 人点赞

WeVisDoc:从覆盖到能力,实现稳健的端到端文档解析

Hugging Face Daily Papers · 2026-09-17 缓存

WeVisDoc 是一个两阶段的以数据为中心的框架,用于稳健的端到端文档解析,通过扩展覆盖范围并使用针对性诊断来提升性能,在基准测试中取得了最先进的结果。

0 人收藏 0 人点赞

编码代理工具架设计的实证研究

Hugging Face Daily Papers · 2026-09-17 缓存

本文实证研究了编码代理的工具架设计,评估了规划和上下文管理等组件,以提高软件工程任务的性能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈