来自 HuggingFace 的文章
本文介绍了Harness-Zero,一种通过agent-as-harness将优化的代理框架蒸馏到大语言模型中的方法,即使在专业框架被移除后,也能显著提升知识工作、工具使用和科学领域的任务性能。
onPanda是一个交互式工具,使用令牌级修正来高效标注大语言模型对齐数据和智能体轨迹,将中位数标注时间减少了52%。
本文提出了一种信息效率比(IER),用于优化稀疏在线策略蒸馏中的令牌选择,证明仅使用1%的令牌就能达到与全面监督相当的性能。
CARE是一个面向视觉-语言-动作策略的框架,通过从执行失败中学习生成纠正动作来增强机器人操作,在模拟和现实世界任务中展示了成功率的提升。
文档检索感知分块(D-RAC)是一种方法,它将企业文档标准化为 PDF,使用多模态 LLM 将其转换为检索优化的 Markdown,并进行高效分块,与代理分块相比,显著降低了 token 使用量和成本。
WorldCrafter是一个视频世界模型,它学习一个可相机查询的隐式3D感知记忆,用于从单张图像或文本提示进行一致且相机可控的流式场景探索。
本文介绍了针对AI智能体框架的正则化递归自我改进(RRSI),该方法在递归进化过程中应用正则化以防止过拟合,在多个基准测试中展示了性能提升。
Hugging Face 发布了 tokenizers v1,这是分词库的重大性能更新,基准测试显示与先前版本相比速度有显著提升。
Qwen-Image-2.1模型的GGUF量化版本,用于使用ComfyUI进行本地图像生成,包含推荐的量化方式和部署设置说明。
Hemmingway-1 是一款拥有270亿参数的开源AI模型,专注于日常写作任务,在用于类似人类沟通的基准测试中表现优于领先模型。
本文提出了Grounded Action Models (GAMs),一种集成3D定位的新型机器人基础模型范式,在操作任务上实现了最先进的性能。
Mira-Scene 引入了一个组合式三维场景重建框架,使用像素对齐的规范坐标图进行精确的对象布局,在布局精度上相较于现有方法实现了显著提升。
本文介绍了一种用于软件工程智能体的类别感知专家训练框架,以缓解不同任务类别间进展不均的问题。该框架采用迭代训练和多教师蒸馏技术,并在Pro-618和SWE-bench Multilingual基准测试上取得了显著性能提升。
本文对视频扩散模型进行可解释性研究,揭示旋转位置嵌入(RoPE)导致过度的空间注意力衰减,从而引发物理违规,并提出一种轻量级的架构修改以增强生成视频的物理连贯性。
UltraTex是一个高效框架,用于基于高分辨率多视角扩散的3D纹理生成,引入了技术以减少冗余并在训练和推理中实现显著加速。
本文提出了RoboDawn,一种将视觉语言模型智能迁移至机器人控制的方法。该方法通过零样本和单样本学习在基准测试中取得了先进结果,并在真实世界应用中验证成功。
Laya 是一款开源的非自回归决策模型,提供带有校准概率的类型化回答,旨在用于电子邮件分类和对话AI等任务,相比现有模型显示出显著的性能提升。
本文介绍了HuRo,一个将人类视频机器人化以创建可扩展VLA预训练数据的流程,展示了在真实世界操作任务中任务完成率和鲁棒性的显著提升。