来自 HuggingFace 的文章
ModaLens是一种配对图像交换审计方法,用于测量报告可用性如何降低医学视觉语言模型中的图像敏感性,通过在MIMIC-CXR数据集上使用MedGemma-27B进行演示。
本文研究了Orthrus的无损性,Orthrus是一种用于推理加速的混合自回归-扩散模型,发现其需要高数值精度(FP32)来实现精确轨迹匹配,而BF16精度偏差并不影响下游性能。
LynnReal-Omni 是一个统一的多模态视频扩散框架,它将智能体视觉控制与高保真生成和实时加速相结合,以实现稳定、可控的视频创作。
本文提出了一种探索引导的提示脚手架框架,该框架动态调整多模态强化学习的训练提示,在基准测试中实现了高达9.7%的相对性能提升。
PhysBrain 1.5 是一个统一模型,通过自回归训练集成物理环境理解、动作生成和未来状态预测,在28个具身基准测试中实现了最先进的开源性能。
Atria Dawn Preview 是一个基础代理型语言模型,专为科学研究设计,取得了有竞争力的基准测试结果,并展示了向人类-AI项目级协作的转变。
本文引入Elo每令牌分析来研究LLM智能体如何分配测试时计算资源,揭示智能体最初优于独立采样但随时间减速,并行会话提供性能提升。
本文提出了一种方法,使氛围设计智能体能够通过结构化设计规范将探索与实现分离,从而探索多样化的UI替代方案。该方法在168个提示和一个超过30万任务的大型在线实验中进行了评估。
HazardAuditor 引入了一个基于执行的框架,用于监督计算机使用代理的安全性,其中 Guard Policy Optimization 将安全结果的准确率提高了多达 16.5%,相比之前的方法。
RSIAgent 是一个无需训练的多智能体框架,它使数字智能体能够通过递归自我改进、自主记忆构建和广度优先然后深度优先的探索来适应新环境,在基准测试中优于闭源模型。
Dream-RSI 是一个用于AI代理的可扩展递归自我改进框架,它利用历史发现树创建重放模拟器,用于离线策略评估,减少在线成本并提高发现效率。
论文介绍了 BVB,这是一个通过在 Blender 中进行程序化重建来基准测试代理视频理解的基准,评估模型在感知相似性和时空事实保留方面的表现。
Discovery Foundation Models 被提议作为通用系统,通过迭代问题表述、假设测试和基于证据的修订,在干湿实验室环境中实现开放式科学发现。本文引入了一个具有问题发现和持续改进等能力的框架,并通过Zetema和GALILEO等系统进行实例化。
这是一个用于YuE2-3B模型的音频分词器和LoRA工具,使用户能够对真实音频录音进行分词并生成新歌曲或翻唱。
本文介绍了管理长上下文长度下训练大型混合专家模型内存峰值的技术,包括Pipelined LLEP、Ring-DTP、SCO和OffloadStreamAdamW,这些技术实现了固定的GPU工作集,并将吞吐量提高了多达10.4倍。
谱移引入了一种谱重参数化方法,通过重塑衰减谱来有效扩展门控 DeltaNet 模型的上下文窗口,并通过持续预训练提升其长上下文处理能力。