标签
本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。
RedNote 已发布 dots3-note preview,这是 dots3 家族中首个开放权重模型,具备 280B 参数和 16B 活跃参数,支持多模态理解(文本、图像、视频、音频),上下文长度为 512K,采用 Apache 2.0 许可证,并具有强大的智能体能力。
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。
VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。
mere.run 是一个面向Apple Silicon和无头Linux的本地优先推理运行时,提供单一CLI用于文本、图像、视频、音乐、3D等,无需Python。
本文提出专家引导的互蒸馏(EGMD)方法,以解决多模态假新闻检测中的领域偏差和语义错配问题,在四个数据集上实现了最先进的准确率,并将领域偏差降低高达57.3%。
本文介绍了探索式建模(Explorative Modeling),这是一种新的生成建模范式,通过探索模型生成与数据之间的候选匹配来分解训练循环。它确立了除参数和数据之外的第三个预训练轴,提高了图像、视频和语言领域的扩展效率,并以更少的推理步骤实现端到端生成建模。
StatePlay 提出了一种状态感知游戏世界模型,该模型联合预测视觉内容和游戏状态,以生成机制一致的游戏推演,在机制保真度上提升了18.6%。
介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。
GLI-AL是一种新的胶质瘤MRI标签资源,统一了解剖和病灶标签,将监督范围扩展至健康组织和先前未标记的异常区域。该资源提供了与BraTS-GLI病例对齐的1,251组标签集。
该论文提出了一种基于状态感知的多模态学习(RAML)方法,用于比特币价格方向预测,该方法根据市场波动性自适应融合社会情绪与技术特征。在2024年7月至2025年9月的小时数据上进行评估,RAML相较于静态融合基线取得了适度的改进。
Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。
BFL 推出了 FLUX 3,这是一个能够生成图像、视频和音频的多模态 AI 模型。
Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。
MindLab Research 发布了 Macaron-V1-Venti,这是一个新的多模态 AI 模型,在 HuggingFace 上可用,可能用于文本到图像或图像生成任务。
本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。
RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。
Thinking Machines 发布了 Inkling,这是一个开源的多模态推理模型,在 post-training RL 方面有创新,实现了稳定扩展到 3000 万+ 次 rollout 和可控的思考投入。该模型展现出压缩推理的特点,即将开放微调。
Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。