来自 HuggingFace 的文章
MintAct 是一系列视觉语言模型,统一了 UI 定位、跨移动、桌面和 Web 的多步导航,以及视觉工具使用,在各种基准测试中达到了最先进的性能。
本文介绍了OmniVBench,一个用于全能参考视频生成的综合基准,以及Omni-R2VDataset,一个大规模训练数据集,以评估和改进R2V模型。
RecreationWorld引入了一个用于混合计算机使用代理的可扩展且可验证的框架,提供了跨越五个平台的环境和一个用于评估的基准测试。
GraphSkillEvo是一个进化优化框架,它将代理技能表示为图结构工件,以提高大型语言模型(LLM)的性能,在多个基准测试中超越基线。
CodeMidas 是一个智能管道,它从源代码创建强化学习环境,扩展编程代理的训练,并在问题修复和程序构建等基准测试中展示性能提升。
RefineEdit 是一种免训练的提示到提示图像编辑方法,它使用生成精炼网络来增强编辑定位和背景保留,实现了顶级的基准分数。
本文评估了Cellpose-SAM在干细胞显微镜中的压缩方案,表明混合精度量化在保持分割精度的同时实现了6.76倍的压缩且无灾难性失败。
Paint-Anything介绍了一种统一的十六进制提示接口,用于图像生成与编辑的颜色控制。该接口在自定义数据集上训练,并通过新基准测试评估,表明在色彩保真度方面有显著提升。
本文提出了一种训练自适应卷积稀疏编码框架,该框架利用信息瓶颈原理实现鲁棒视觉表示,在CIFAR和ImageNet数据集上,在输入扰动下取得了性能提升。
本文介绍了TeleAntiFraud 2.0,这是一个基于音频的基准,用于评估电信欺诈检测模型,采用混合树生成流水线和每月冻结集,以应对不断演变的欺诈脚本和近域负样本。
引入Movement Trend Guidance以增强机器人操作中的3D扩散策略,通过无显式轨迹提供预见性,在RoboTwin2.0和LIBERO-40等基准测试上实现性能提升。
本研究探讨了AI生成的评审影响未来AI评审者训练的反馈循环,导致判断多样性降低,这种现象称为'科学判断崩溃'。同时介绍了TrustReviewer,这是一个开源系统,通过精选训练和激活引导来缓解这一问题。
DeformSmith是一个框架,用于从文本或图像生成交互式、物理可信的可变形资产,通过物理引导的分层生成来提高质量和可信度。
本文研究了基于策略的蒸馏如何因师生模型间EOS token不匹配而导致输出长度膨胀,并提出了一种通过聚合EOS概率来减少响应长度的纠正方法。
FAMOS 是一个前馈模型,它使用多状态关节变换器和程序化数据生成器,从稀疏点云中预测可移动部分分割和关节参数,在实验中显示出相比基线方法的一致性改进。
本文介绍了ActObs,一种监督智能体轨迹中动作和观察标记的方法,以改善强化学习探索,并在Terminal-Bench2.0和aider-polyglot等基准测试中展示了性能提升。
WeVisDoc 是一个两阶段的以数据为中心的框架,用于稳健的端到端文档解析,通过扩展覆盖范围并使用针对性诊断来提升性能,在基准测试中取得了最先进的结果。