来自 HuggingFace 的文章
UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。
本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。
Laya 是一款开源的非自回归决策模型,提供带有校准概率的类型化回答,旨在用于电子邮件分类和对话AI等任务,相比现有模型显示出显著的性能提升。
本文介绍了HuRo,一个将人类视频机器人化以创建可扩展VLA预训练数据的流程,展示了在真实世界操作任务中任务完成率和鲁棒性的显著提升。
本文提出PARTS,一个现实世界子任务强化学习框架,通过专注于瓶颈子任务并最小化人工干预来提升长期操作任务,在实验中实现了更高的成功率。
本文介绍了APort Vault,这是一个用于评估AI代理支付授权的基准测试,涵盖了超过225,000个评估,涉及14个模型,以测试安全策略和Open Agent Passport规范。
本文介绍了OmniVChat这一原生视听对话任务,并提出了数据引擎、基准测试和强化学习方法,用于训练和评估全能模型,在合成数据和人类录制数据上展示了性能提升。
MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。
本文介绍了OmniVBench,一个用于全能参考视频生成的综合基准,以及Omni-R2VDataset,一个大规模训练数据集,以评估和改进R2V模型。
RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。
GraphSkillEvo是一个进化优化框架,它将代理技能表示为图结构工件,以提高大型语言模型(LLM)的性能,在多个基准测试中超越基线。
CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。
RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。
本文评估了Cellpose-SAM在干细胞显微镜中的压缩方案,表明混合精度量化在保持分割精度的同时实现了6.76倍的压缩且无灾难性失败。
Paint-Anything介绍了一种统一的十六进制提示接口,用于图像生成与编辑的颜色控制。该接口在自定义数据集上训练,并通过新基准测试评估,表明在色彩保真度方面有显著提升。
本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。
本文介绍了TeleAntiFraud 2.0,这是一个基于音频的基准,用于评估电信欺诈检测模型,采用混合树生成流水线和每月冻结集,以应对不断演变的欺诈脚本和近域负样本。