标签
UniH3 提出了一种统一框架,用于一体化医学图像恢复,通过利用层级同质性和异质性,在基准测试中实现了最先进的性能。
EditVid是一个统一的无训练视频编辑框架,利用稀疏因果记忆、令牌注入和软潜在混合,支持指令引导和主题引导的编辑,实现高保真并在基准测试中优于基线方法。
RouteTS是一个统一的预测框架,基于频谱特性在频率域和时间域之间路由时间序列分量,提高了处理周期性和瞬态性的准确性和效率。
GenRouter 是一个用于代理式图像生成的统一路由框架,能够自适应地将提示引导至最优工作流,通过需求建模和自我进化显著降低成本与延迟,同时提升视觉对齐效果。
MUGEN 提出了一个统一的运动-语言框架,避免了离散码本和迭代解码,使用带有连续潜变量槽位的单一自适应长度自编码器以及一次性生成,在 HumanML3D 和 SnapMoGen 基准上实现了高效、高质量的文本到运动与运动到文本性能。
本文介绍了一种离散扩散模型的统一概念框架,通过分词、状态空间构建来分析其设计空间,并强调了训练、推理和扩展中的权衡。
介绍 Flex-Forcing,一个统一的训练和推理框架,通过灵活的时间与去噪步骤分块机制,使视频扩散模型能在双向和自回归两种模式下运行,实现更好的视频质量、长视频稳定性和更快的推理速度。
介绍Qwen-RobotManip,一个用于机器人操控的视觉-语言-动作基础模型,通过在表征、运动和行为维度上的统一对齐实现泛化,从而能够在多样化的数据源上进行大规模训练。它在多个分布外基准测试中优于先前的最先进模型,并展现出涌现能力,如零样本指令跟随和跨本体迁移。
本文提出了一种统一的多模态框架,融合强化学习、高频交易、博弈论方法及跨模态情感分析,用于构建智能金融系统,并声称相比单领域系统有显著提升。
本文提出了一个用于大型语言模型测试时多样化生成的统一框架,根据多样性注入的位置(表面级 vs. 规范级)对方法进行分类。它提出了规范级方法,首先生成多样化的中间规范,然后基于这些规范生成最终响应。在五个开放任务和四个骨干模型上,规范级注入在保持质量的同时提升了输出多样性。
ThinkBooster是一个用于LLM推理的测试时计算扩展的统一框架,提供了模块化Python库、性能-效率基准、兼容OpenAI的代理服务以及可视化调试器。在数学和编程任务上的实证结果展示了实际收益以及质量-成本权衡。
CIPER是一个统一的Transformer框架,能够联合执行城市级跨视图图像检索和精确的三自由度(3-DoF)姿态估计,克服了级联管道的局限性。
OmniRetrieval 是一个框架,通过将原生查询分派到适当的执行引擎,统一了跨异构知识源(文本、表格、图)的检索,在包含13个数据集和309个知识库的基准测试中,优于单源基线。
FashionLens提出了一种统一的多模态大语言模型时尚图像检索框架,采用自适应校准与采样策略,在多种检索场景下实现了最先进的性能。
Aurora 是一个基于代理的视频编辑框架,它将一个工具增强的视觉语言模型代理与扩散变换器配对,自动解决用户请求中的文本和视觉未指定性,从而实现统一视频编辑任务,如替换、移除、风格迁移和参考驱动插入。
Skill1 是一个统一框架,通过共享的任务结果目标,训练单一策略以协同进化技能选择、利用与蒸馏。在 ALFWorld 和 WebShop 上的实验表明,该框架在复杂任务环境中优于现有的基线方法。
本文介绍了 UniVidX 论文,该论文提出了一种利用扩散先验进行视频生成的统一多模态框架,并讨论了其跨模态一致性机制。
UniMesh通过单一模型,借助Mesh Head、链式网格迭代编辑和自省纠错机制,同时完成3D网格生成与理解任务。