multi-modal

标签

Cards List
#multi-modal

PhysioBench:生理信号问答的统一基准

arXiv cs.CL ↗ · 5天前 缓存

PhysioBench引入了一个统一的生理信号问答基准,整合22个数据集成6140万道问题,涵盖30项任务,以评估各种AI模型的性能。

0 人收藏 0 人点赞
#multi-modal

Ovis-Embedding:推动通用全模态嵌入的前沿

Hugging Face Daily Papers ↗ · 5天前 缓存

本文介绍了Ovis-Embedding,一种最先进的全模态嵌入模型,它使用共享骨干网络将文本、图像、视频和音频编码到公共表示空间中,在MMEB-v3和MVEB等基准测试上取得了顶级性能。

0 人收藏 0 人点赞
#multi-modal

在令牌级别引导LLM与智能体:一个支持令牌可视化控制、模型检查及数据标注的交互工具。

Reddit r/LocalLLaMA ↗ · 2026-09-19

onPanda是一个交互式工具,专注于LLM与智能体的令牌级可视化与控制,提供数据标注、模型检查,并支持多模态操作,包括在浏览器中执行。

0 人收藏 0 人点赞
#multi-modal

UFO:多模态图像生成中全条件对齐的链式评估

Hugging Face Daily Papers ↗ · 2026-09-17 缓存

UFO 是一个统一框架,用于多模态图像生成中全条件对齐的同时评估。它引入了原子化链式评估范式和 UFO-Bench 基准测试。

0 人收藏 0 人点赞
#multi-modal

AlexWortega/openjev

Hugging Face Models Trending ↗ · 2026-09-16 缓存

openjev 是一个基于 Qwen3.5 的模型,为蕴含任务而训练,使其能够在重排序、评分和实时游戏等应用中使用,v2 版本增加了多模态能力和改进的零样本性能。

0 人收藏 0 人点赞
#multi-modal

MiniMax-H3 能否推理物理世界?全模态生成模型评估

Hugging Face Daily Papers ↗ · 2026-09-16 缓存

本文通过引入一个综合框架来评估 MiniMax-H3——一种全模态生成模型——在通过多模态输入推理物理世界方面的能力。评估显示,基于视频的决策推理表现最佳,而基于音频的歧义推理则最弱。

0 人收藏 0 人点赞
#multi-modal

@svpino: 我一直在使用 ElevenLabs 处理音频。现在,他们添加了图像功能。现在大家都支持所有功能。AI 正在模糊界限。

X AI KOLs Following ↗ · 2026-09-14 缓存

ElevenLabs 已在其 MCP 平台上添加了图像和视频生成功能,超越音频,支持多模态内容创作。

0 人收藏 0 人点赞
#multi-modal

跨模态上下文学习的趋同涌现

Hugging Face Daily Papers ↗ · 2026-09-12 缓存

本文提出了 Convergent Emergence Hypothesis,指出少样本上下文学习在跨模态难度剖面上具有共同性,并通过六种模态的实验提供实证支持,显示其中五种模态存在相关性效应。

0 人收藏 0 人点赞
#multi-modal

全交互智能体技术报告

Hugging Face Daily Papers ↗ · 2026-09-08 缓存

本文提出Gander,一个用于全交互和智能体任务的端到端框架,通过Cerebellum-Brain架构实现跨多种模态的实时全双工交互。

0 人收藏 0 人点赞
#multi-modal

SimpleDesign:一种用于蛋白质序列与结构协同设计的联合模型

arXiv cs.LG ↗ · 2026-09-04 缓存

SimpleDesign 引入了一种用于蛋白质序列与结构协同设计的联合模型,该模型在数据空间中使用单阶段目标进行端到端训练,在协同设计和生成基准测试中取得了具有竞争力的性能。

0 人收藏 0 人点赞
#multi-modal

MULTI3IR: 一个多视角多领域多模态信息检索基准

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

本文介绍了Multi3IR,一个多视角、多领域、多模态信息检索基准,并提出了SPIN,一种改进检索系统视角覆盖的方法。

0 人收藏 0 人点赞
#multi-modal

DICS:探索视觉指令选择中的数据内在一致性

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

DICS引入了一种自评分指标用于视觉指令数据选择,通过确保样本内一致性,以显著更少的数据提升视觉语言模型性能,优于最先进方法。

0 人收藏 0 人点赞
#multi-modal

Poly-InstructTTS:从开放式指令学习真实场景中富有表现力的语音合成

arXiv cs.CL ↗ · 2026-08-24 缓存

Poly-InstructTTS是一个文本转语音系统,它使用大规模多模态数据集从开放式自然语言指令中学习富有表现力的语音,从而提高TTS模型中的指令遵循度和表现力。

0 人收藏 0 人点赞
#multi-modal

@DevAdventur3s: Ox Alpha = Gemini 4.0 有人在 @opencode 或 @OpenRouter 上试用过吗?

X AI KOLs Timeline ↗ · 2026-08-22 缓存

该推文宣布 Ox Alpha(等同于 Gemini 4.0)在 OpenCode 上免费提供一周,具备 1M 上下文、多模态能力和零数据保留功能。

0 人收藏 0 人点赞
#multi-modal

一款名为 Ox-Alpha 的隐秘模型已经发布,在 SWE 上表现优于 Fable。

Reddit r/singularity ↗ · 2026-08-21 缓存

一款名为 Ox-Alpha 的隐秘AI模型据报告已经发布,在 SWE 基准测试中优于 Fable,并且可以免费使用,具备多模态支持和零数据保留等功能。

0 人收藏 0 人点赞
#multi-modal

@thegenioo: 为什么这隐身模型在前端方面这么厉害?

X AI KOLs Timeline ↗ · 2026-08-20 缓存

OpenRouter 发布了一款名为 Ox Alpha 的新型隐身 AI 模型,该模型针对高效编码和代理任务进行了优化,具备 1M 令牌上下文窗口,并支持文本、图像和视频输入。

0 人收藏 0 人点赞
#multi-modal

通过模态子空间激活诊断与缓解全模态LLM中的感知-决策失调

arXiv cs.LG ↗ · 2026-08-18 缓存

本文诊断了全模态LLM中的感知-决策失调问题,并提出了一种名为模态子空间激活的无训练推理时框架,通过动态平衡模态强度来缓解这一问题。

0 人收藏 0 人点赞
#multi-modal

多模态生成模糊系统:模糊推理引导的大模型交互式问答框架

arXiv cs.CL ↗ · 2026-08-18 缓存

本文提出多模态生成模糊系统(MMGFS),通过模糊推理和多跳推理解决模态偏差和不确定性,以提升多模态问答性能,并在多个基准测试中展示改进。

0 人收藏 0 人点赞
#multi-modal

MAG:流形引导的半监督多模态上下文学习

arXiv cs.LG ↗ · 2026-08-14 缓存

本文介绍了MAG,一种流形引导的半监督多模态上下文示例选择框架,利用未标记数据改进多模态大语言模型的少样本上下文学习。在八个基准上的实验表明,在标签稀缺场景下取得了一致的性能提升。

0 人收藏 0 人点赞
#multi-modal

@AdinaYakup: 更多参与者加入开源夏季 RedNote 刚刚发布了 dots3-note preview,首个开放权重模型在…

X AI KOLs Following ↗ · 2026-08-14 缓存

RedNote 已发布 dots3-note preview,这是 dots3 家族中首个开放权重模型,具备 280B 参数和 16B 活跃参数,支持多模态理解(文本、图像、视频、音频),上下文长度为 512K,采用 Apache 2.0 许可证,并具有强大的智能体能力。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈