标签
PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。
本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。
onPanda是一个交互式工具,专注于LLM与智能体的令牌级可视化与控制,提供数据标注、模型检查,并支持多模态操作,包括在浏览器中执行。
UFO 是一个统一框架,用于多模态图像生成中全条件对齐的同时评估。它引入了原子化链式评估范式和 UFO-Bench 基准测试。
openjev 是一个基于 Qwen3.5 的模型,为蕴含任务而训练,使其能够在重排序、评分和实时游戏等应用中使用,v2 版本增加了多模态能力和改进的零样本性能。
本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。
ElevenLabs 已在其 MCP 平台上添加了图像和视频生成功能,超越音频,支持多模态内容创作。
本文提出了 Convergent Emergence Hypothesis,指出少样本上下文学习在跨模态难度剖面上具有共同性,并通过六种模态的实验提供实证支持,显示其中五种模态存在相关性效应。
本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。
SimpleDesign 引入了一种用于蛋白质序列与结构协同设计的联合模型,该模型在数据空间中使用单阶段目标进行端到端训练,在协同设计和生成基准测试中取得了具有竞争力的性能。
本文介绍了Multi3IR,一个多视角、多领域、多模态信息检索基准,并提出了SPIN,一种改进检索系统视角覆盖的方法。
DICS引入了一种自评分指标用于视觉指令数据选择,通过确保样本内一致性,以显著更少的数据提升视觉语言模型性能,优于最先进方法。
Poly-InstructTTS是一个文本转语音系统,它使用大规模多模态数据集从开放式自然语言指令中学习富有表现力的语音,从而提高TTS模型中的指令遵循度和表现力。
该推文宣布 Ox Alpha(等同于 Gemini 4.0)在 OpenCode 上免费提供一周,具备 1M 上下文、多模态能力和零数据保留功能。
一款名为 Ox-Alpha 的隐秘AI模型据报告已经发布,在 SWE 基准测试中优于 Fable,并且可以免费使用,具备多模态支持和零数据保留等功能。
OpenRouter 发布了一款名为 Ox Alpha 的新型隐身 AI 模型,该模型针对高效编码和代理任务进行了优化,具备 1M 令牌上下文窗口,并支持文本、图像和视频输入。
本文诊断了全模态LLM中的感知-决策失调问题,并提出了一种名为模态子空间激活的无训练推理时框架,通过动态平衡模态强度来缓解这一问题。
本文提出多模态生成模糊系统(MMGFS),通过模糊推理和多跳推理解决模态偏差和不确定性,以提升多模态问答性能,并在多个基准测试中展示改进。
本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。
RedNote 已发布 dots3-note preview,这是 dots3 家族中首个开放权重模型,具备 280B 参数和 16B 活跃参数,支持多模态理解(文本、图像、视频、音频),上下文长度为 512K,采用 Apache 2.0 许可证,并具有强大的智能体能力。