multi-modal

标签

Cards List
#multi-modal

MAG:流形引导的半监督多模态上下文学习

arXiv cs.LG · 2天前 缓存

本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。

0 人收藏 0 人点赞
#multi-modal

@AdinaYakup: 更多参与者加入开源夏季 RedNote 刚刚发布了 dots3-note preview,首个开放权重模型在…

X AI KOLs Following · 2天前 缓存

RedNote 已发布 dots3-note preview,这是 dots3 家族中首个开放权重模型,具备 280B 参数和 16B 活跃参数,支持多模态理解(文本、图像、视频、音频),上下文长度为 512K,采用 Apache 2.0 许可证,并具有强大的智能体能力。

0 人收藏 0 人点赞
#multi-modal

多模态大语言模型安全格局的演变:新兴威胁与防护措施综述

arXiv cs.LG · 5天前 缓存

一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。

0 人收藏 0 人点赞
#multi-modal

GEOID-Flood:用于洪水分割的大规模多模态基准数据集

Hugging Face Daily Papers · 2026-08-03 缓存

介绍了GEOID-Flood,这是一个用于洪水分割的大规模多模态基准数据集,包含来自65个国家219个事件的超过14,000个瓦片,在单图像、多时相和多模态协议下,将基础模型与传统编码器进行了评估。

0 人收藏 0 人点赞
#multi-modal

@tom_doerr: VideoAgent 是一个一体化的开源框架,用于全面视频智能,结合理解、编辑和创意生成…

X AI KOLs Timeline · 2026-08-02 缓存

VideoAgent 是一个一体化的开源框架,用于全面视频智能,通过统一的智能体工作流结合理解、编辑和创意生成。

0 人收藏 0 人点赞
#multi-modal

Show HN:一个CLI实现本地文本、图像、视频、音乐和3D,无需Python

Hacker News Top · 2026-07-30 缓存

mere.run 是一个面向Apple Silicon和无头Linux的本地优先推理运行时,提供单一CLI用于文本、图像、视频、音乐、3D等,无需Python。

0 人收藏 0 人点赞
#multi-modal

检测器失效之处:通过专家引导的互蒸馏弥合尾部领域差距

arXiv cs.CL · 2026-07-30 缓存

本文提出专家引导的互蒸馏(EGMD)方法,以解决多模态假新闻检测中的领域偏差和语义错配问题,在四个数据集上实现了最先进的准确率,并将领域偏差降低高达57.3%。

0 人收藏 0 人点赞
#multi-modal

探索式建模:解锁第三个预训练轴与端到端生成

Hugging Face Daily Papers · 2026-07-29 缓存

本文介绍了探索式建模(Explorative Modeling),这是一种新的生成建模范式,通过探索模型生成与数据之间的候选匹配来分解训练循环。它确立了除参数和数据之外的第三个预训练轴,提高了图像、视频和语言领域的扩展效率,并以更少的推理步骤实现端到端生成建模。

0 人收藏 0 人点赞
#multi-modal

StatePlay:状态感知游戏世界模型,用于机制一致生成

Hugging Face Daily Papers · 2026-07-29 缓存

StatePlay 提出了一种状态感知游戏世界模型,该模型联合预测视觉内容和游戏状态,以生成机制一致的游戏推演,在机制保真度上提升了18.6%。

0 人收藏 0 人点赞
#multi-modal

VlogReward:学习面向Vlog编辑的多维度评估

arXiv cs.AI · 2026-07-28 缓存

介绍了VlogReward,一个用于评估Vlog编辑计划在六个维度上的奖励模型,同时附带大规模数据集和基准测试,在与GPT-5和Gemini-3-Pro的对比中取得了最先进的结果。

0 人收藏 0 人点赞
#multi-modal

GLI-AL:一种具有统一解剖-病灶标签的多模态胶质瘤MRI标签资源

Hugging Face Daily Papers · 2026-07-27 缓存

GLI-AL是一种新的胶质瘤MRI标签资源,统一了解剖和病灶标签,将监督范围扩展至健康组织和先前未标记的异常区域。该资源提供了与BraTS-GLI病例对齐的1,251组标签集。

0 人收藏 0 人点赞
#multi-modal

基于状态感知的多模态融合社会情绪与技术特征的比特币价格方向预测

Hugging Face Daily Papers · 2026-07-25 缓存

该论文提出了一种基于状态感知的多模态学习(RAML)方法,用于比特币价格方向预测,该方法根据市场波动性自适应融合社会情绪与技术特征。在2024年7月至2025年9月的小时数据上进行评估,RAML相较于静态融合基线取得了适度的改进。

0 人收藏 0 人点赞
#multi-modal

Black Forest Lab's Flux 3: 全模态用于图像、视频、音频和动作预测

Reddit r/singularity · 2026-07-23

Black Forest Lab's Flux 3 是一种新型的全模态AI模型,能够生成和预测图像、视频、音频和动作。

0 人收藏 0 人点赞
#multi-modal

BFL 推出 FLUX 3 - 支持图像、视频和音频的多模态模型

Reddit r/ArtificialInteligence · 2026-07-23

BFL 推出了 FLUX 3,这是一个能够生成图像、视频和音频的多模态 AI 模型。

0 人收藏 0 人点赞
#multi-modal

Fusion Embedding:文本、图像、视频与音频的统一嵌入空间

arXiv cs.CL · 2026-07-22 缓存

Fusion Embedding 引入了一个模型系列,将音频添加至冻结的视觉-语言嵌入主干网络,从而实现文本、图像、视频和音频检索的统一嵌入空间。该系列模型仅训练轻量级适配器,无需配对音视频数据即可实现音频-图像检索。

0 人收藏 0 人点赞
#multi-modal

mindlab-research/Macaron-V1-Venti • HuggingFace

Reddit r/LocalLLaMA · 2026-07-21

MindLab Research 发布了 Macaron-V1-Venti,这是一个新的多模态 AI 模型,在 HuggingFace 上可用,可能用于文本到图像或图像生成任务。

0 人收藏 0 人点赞
#multi-modal

Token级别跨模态Transformer与对比多任务学习用于乳腺癌亚型分类和生存预测

arXiv cs.LG · 2026-07-21 缓存

本文提出了UMMT,一种基于Token级别的跨模态Transformer与对比多任务学习,用于乳腺癌亚型分类和生存预测,在METABRIC和TCGA-BRCA数据集上取得了最先进的结果。

0 人收藏 0 人点赞
#multi-modal

RynnBrain 1.1:迈向更强大、更具泛化能力的具身基础模型

Hugging Face Daily Papers · 2026-07-20 缓存

RynnBrain 1.1是一系列具身基础模型(2B、9B、122B-A10B),提升了感知、空间推理和操作能力,在VSI-Bench、MMSI和RefSpatial-Bench上取得了最先进的结果,并在真实机器人实验中超越了基线模型。

0 人收藏 0 人点赞
#multi-modal

为团队感到无比自豪。经历了无数个深夜,Inkling 终于发布了,我特别想强调 post-……

X AI KOLs Timeline · 2026-07-15 缓存

Thinking Machines 发布了 Inkling,这是一个开源的多模态推理模型,在 post-training RL 方面有创新,实现了稳定扩展到 3000 万+ 次 rollout 和可控的思考投入。该模型展现出压缩推理的特点,即将开放微调。

0 人收藏 0 人点赞
#multi-modal

Hallo4D: 多模态幻觉缓解实现一致时空生成

Hugging Face Daily Papers · 2026-07-15 缓存

Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈