multimodal

标签

Cards List
#multimodal

@ayushrajnc1z: 这感觉不像又一次AI视频更新,而更像一个正规制作工作流的开端。三十秒视频…

X AI KOLs Timeline · 昨天 缓存

Seedance 2.5 引入了30秒视频生成、多模态参考、多语言创作和定向编辑,面向开发者和企业的API访问即将在BytePlus上线。

0 人收藏 0 人点赞
#multimodal

@samsja19:很棒的基准

X AI KOLs Following · 昨天 缓存

介绍 VGI-Bench,这是一个多模态基准测试,通过 550 个人工策划的问题来评估 12 种不同的视觉和视听技能,旨在暴露当今视频基准测试中的不足。

0 人收藏 0 人点赞
#multimodal

@samsja19: 与多智能体一起到来的还有 prime-rl 0.8.0 版本,自 0.7.0 以来共有 13 位贡献者提交了 98 个 commit,菜单上有:1. 多智能体…

X AI KOLs Following · 昨天 缓存

Prime Intellect 发布了 prime-rl 0.8.0,增加了多智能体训练、Nixl 和 Model Express 权重广播、扩展的多模态支持,以及多项性能改进。

0 人收藏 0 人点赞
#multimodal

@Saccc_c: 想给deepseek v4 flash增加多模态能力,强烈建议配合qwen3.7-flash使用,目前最高性价比的模型组合 qwen3.7-flash是一个轻量多模态模型,速度快也很适合大部分图片理解任务。关键价格也够低,现在注册有100…

X AI KOLs Timeline · 昨天 缓存

推荐将 DeepSeek v4 flash 与 qwen3.7-flash 组合使用,以低成本为 DeepSeek 增加多模态图片理解能力,并提供了通过阿里云百炼和 Codex 的简单配置步骤。

0 人收藏 0 人点赞
#multimodal

Gemini

Reddit r/singularity · 2天前

谷歌的Gemini AI模型代表了多模态AI能力的重大进步。

0 人收藏 0 人点赞
#multimodal

MoCA:隐式社会情境分析

arXiv cs.CL · 2天前 缓存

介绍了 MoCA(隐式社会情境分析),这是一个新的任务和基准,用于在情感、意图和立场三个维度上建模隐式社会场景,并提出了冲突驱动溯因推理(CoDAR)框架。实验表明,最先进的多模态大语言模型在此任务上表现困难,而 CoDAR 能提升性能,但仍与人类推理存在较大差距。

0 人收藏 0 人点赞
#multimodal

M$^3$R-Bench:证据支撑的多模态隐喻理解统一基准

arXiv cs.CL · 2天前 缓存

本文介绍了M3R-Bench,一个包含1,000个图文实例的统一证据支撑多模态隐喻理解基准,并提出了M3R-Reasoner,一个结合基于课程学习的推理监督和强化学习的8B参数模型,其性能优于更大的专有模型。

0 人收藏 0 人点赞
#multimodal

PRISM:通过结构化多模态数据合成实现优先级感知的规则内化

arXiv cs.LG · 2天前 缓存

本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。

0 人收藏 0 人点赞
#multimodal

将感知与描述解耦:多元时间序列与语言之间的计算基础表征对齐

arXiv cs.LG · 2天前 缓存

本文介绍了CGTime,一个4B参数的计算基础时间序列-语言模型,通过确定性统计和LLM言语化将感知与描述解耦,在多元理解任务上优于更大的通用模型。

0 人收藏 0 人点赞
#multimodal

RIG-RoPE: Relation- and Instance-Gated Rotary Positional Encoding with Duration-Aware Temporal Coordinates

arXiv cs.CL · 2天前 缓存

This preliminary technical report proposes RIG-RoPE, a relation- and instance-gated rotary positional encoding with duration-aware temporal coordinates, aiming to address spatial interference and improper temporal scaling in multimodal LLMs. It introduces a gating mechanism for height/width rotations and duration-aware temporal coordinates, but leaves large-scale empirical validation to future work.

0 人收藏 0 人点赞
#multimodal

统一智能体:跨设备交互管理

arXiv cs.AI · 2天前 缓存

本文介绍了统一智能体(Unified Agent),一种有状态的AI智能体,能够在设备和时间上维护紧凑的交互状态,以处理跨设备、跨时间的用户请求,在新基准测试中优于现有智能体设计。

0 人收藏 0 人点赞
#multimodal

C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现

arXiv cs.AI · 2天前 缓存

介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。

0 人收藏 0 人点赞
#multimodal

@DanKornas:构建实时语音智能体需要协调音频流、轮次检测、中断、模型调用和媒体路由…

X AI KOLs Timeline · 2天前 缓存

VideoSDK AI Agents 是一个开源 Python 框架,用于构建生产可用的实时语音和多模态 AI 智能体,这些智能体可以以参与者身份加入 VideoSDK 房间,支持统一 Pipeline 配置和多种执行模式。

0 人收藏 0 人点赞
#multimodal

@Letian_Wang_6: 语言用了自回归,其他一切都用了扩散——这是一个不稳定的均衡。最近一直困扰我的问题是:……

X AI KOLs Following · 2天前 缓存

一位研究者思考这种不稳定的均衡:语言使用自回归模型,而其他模态使用扩散模型,并推测统一的多模态架构取决于每种模态揭示信息的顺序。他为此押下了赌注。

0 人收藏 0 人点赞
#multimodal

Nvidia 的 Nemotron Omni 在 Mac 上只能加载文本部分,所以我用 MLX 编写了视觉和音频塔

Reddit r/LocalLLaMA · 2天前

作者为 Nvidia 的 Nemotron Omni 模型的视觉和音频塔编写了一个纯 MLX 运行时,使完整的多模态模型能够在 Apple Silicon Mac 上本地运行。所有 23 项测试均通过 PyTorch 参考验证,在 M5 Max 上实现了 67-152 tok/s 的速度。

0 人收藏 0 人点赞
#multimodal

@shedntcare_:Seedance 2.5 已在 CapCut 上全球发布:更少的重新生成、更少的完全重建,以及从提示到最终成片的更短路径……

X AI KOLs Timeline · 2天前 缓存

Seedance 2.5 已在 CapCut 上全球发布,提供更少的重新生成次数,并支持最多 50 个多模态参考,以改善创意方向并简化从提示到最终视频的路径。

0 人收藏 0 人点赞
#multimodal

nvidia/NVIDIA-Nemotron-Parse-2.0 · Hugging Face

Reddit r/LocalLLaMA · 2天前 缓存

NVIDIA 发布 Nemotron Parse 2.0,这是一个文档图像解析模型,可将扫描的 PDF 和图像转换为带有布局、边界框和阅读顺序的结构化文本,并增加了多语言 OCR 改进和图表感知解析功能。

0 人收藏 0 人点赞
#multimodal

Unsloth 的 Gemma 4 mmproj 在新版 llama.cpp 构建中悄然破坏了视觉与音频功能——还有人遇到这个问题吗?

Reddit r/LocalLLaMA · 2天前

一位开发者报告称,使用 Unsloth 的 GGUF 模型时,Gemma 4 的多模态功能在较新的 llama.cpp 构建中被破坏,原因是不兼容的 mmproj 文件。切换到 ggml-org 的官方模型后问题立即解决,这凸显了第三方量化器与 llama.cpp 更新之间反复出现的兼容性问题。

0 人收藏 0 人点赞
#multimodal

@heyshrutimishra: - 超宽全景长卷。 - 产品海报。 - 商业摄影。 SenseNova U1.5-Lite-Preview 生成所有…

X AI KOLs Following · 3天前 缓存

SenseNova U1.5-Lite-Preview 是一个开源的 8B MoT 多模态模型,能够原生生成和编辑 4K 超宽全景、产品海报和商业摄影,具有改进的材质渲染和更少的伪影。

0 人收藏 0 人点赞
#multimodal

EmpaAva:一个开源的智能体3D虚拟形象共情实时聊天机器人

arXiv cs.CL · 3天前 缓存

本文介绍了EmpaAva,据我们所知,这是首个开源的智能体3D虚拟形象共情聊天机器人,通过三智能体LLM架构实现实时的、面对面的多模态共情,在情感理解、响应质量和视听一致性方面超越了基线系统。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈