multi-modal

标签

Cards List
#multi-modal

ProcessThinker: 通过基于展开的过程奖励增强多模态大语言模型推理

arXiv cs.CL · 2026-06-11 缓存

ProcessThinker 引入了一种实用的后训练流程,无需训练显式的过程奖励模型即可提供步骤级的过程奖励。它利用基于展开的奖励为多模态大语言模型中的多步推理提供密集的信用分配,在视频基准测试上持续提升性能。

0 人收藏 0 人点赞
#multi-modal

使用多模态语言模型检测社交媒体上的AI生成内容

arXiv cs.CL · 2026-06-11 缓存

来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。

0 人收藏 0 人点赞
#multi-modal

统一多模态智能金融系统框架:整合强化学习、高频交易、博弈论方法与跨模态情感分析

arXiv cs.AI · 2026-06-10 缓存

本文提出了一种统一的多模态框架,融合强化学习、高频交易、博弈论方法及跨模态情感分析,用于构建智能金融系统,并声称相比单领域系统有显著提升。

0 人收藏 0 人点赞
#multi-modal

面向基于证据的计算病理学的多模态智能体协同助手

arXiv cs.AI · 2026-06-09 缓存

PathPocket是一个多模态AI智能体协同助手,专门用于基于证据的病理学,利用全面的证据语料库和超图,在超过20万个真实病例上超越了现有最先进的方法。

0 人收藏 0 人点赞
#multi-modal

工业场景中的零样本学习:新的大规模基准、挑战与基线

arXiv cs.AI · 2026-06-09 缓存

本文提出了一个用于零样本工业缺陷检测的大规模多模态数据集(MMIO),并介绍了改进文本-视觉提示(RTVP)方法,在该基准上取得了最优结果。

0 人收藏 0 人点赞
#multi-modal

封闭-开放工业检测场景的统一:新的大规模基准、挑战与基线

arXiv cs.AI · 2026-06-09 缓存

介绍了MMIOC-1M,一个用于工业缺陷检测的大规模多模态基准,并提出了RTVPNet,一种精细的文本-视觉提示网络,实现了最先进的性能。

0 人收藏 0 人点赞
#multi-modal

PathoSage:通过经验感知的代理工作流实现病理学中的多源证据裁决

arXiv cs.AI · 2026-06-09 缓存

PathoSage 提出了一个三阶段框架,用于病理学多模态推理,该框架将知识检索、证据收集和证据裁决分开,以减少幻觉并处理冲突证据,并包含一个无需训练的 Beta-Bernoulli 经验系统,用于建模工具可靠性。

0 人收藏 0 人点赞
#multi-modal

Az8 Studio:我们最接近多模态“智能体”画布的视频管线工具?(初印象)

Reddit r/AI_Agents · 2026-06-08

Az8 Studio 是一个无限画布,带有互联节点,用于多模态 AI 视频管线,支持跨节点的上下文记忆、并行多模型编排以及持久化资产到智能体的工作流。它代表着从线性 AI 工具向空间智能体环境的转变。

0 人收藏 0 人点赞
#multi-modal

面向车辆网络的联邦基础模型

arXiv cs.LG · 2026-06-08 缓存

本文提出了将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,讨论了训练原理、应用场景、挑战以及基于Waymo开放数据集的案例研究。

0 人收藏 0 人点赞
#multi-modal

@hasantoxr: Google 打造了 NotebookLM。现在一位开发者构建了一个更好的版本,可以将你的文件变成私有的 AI 研究助手……

X AI KOLs Timeline · 2026-06-07 缓存

Open Notebook 是一个开源、注重隐私的 Google NotebookLM 替代品,可本地运行并支持多种 AI 模型,用于研究辅助。

0 人收藏 0 人点赞
#multi-modal

OmniCap-IF:全模态视频字幕生成中指令跟随能力的基准测试与提升

Hugging Face Daily Papers · 2026-06-07 缓存

介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。

0 人收藏 0 人点赞
#multi-modal

@ai_xiaomu: macbook 16g 就能跑的满血多模态本地模型来了: 1. 下载LM studio; 2. 搜索gemma 4 12B 并下载安装; 3. 告诉codex帮你配置好本地api参数; 4. 接下体验token自由的感觉吧。

X AI KOLs Timeline · 2026-06-05 缓存

指导用户在MacBook 16GB上通过LM Studio和Codex运行Gemma 4 12B多模态本地模型,实现自由使用token。

0 人收藏 0 人点赞
#multi-modal

@seclink: 冷知识: 目前多模态大模型创业的具体落地方向通常有如下方向,如果都不是你感兴趣的话,还是别赶时髦,乖乖回去学AI coding吧 : 1. 游戏 AI NPC / 智能体中间件(如端云协同的 OmniNPC,赋能 3D 角色交互与情感叙事…

X AI KOLs Timeline · 2026-06-03 缓存

总结了当前多模态大模型创业的几个主要落地方向,包括游戏AI NPC、企业级多模态Agent、内容生成、具身智能和视觉代码助手等。

0 人收藏 0 人点赞
#multi-modal

M^3Eval:基于认知心理学的视频任务多模态记忆评估

Hugging Face Daily Papers · 2026-06-03 缓存

M^3Eval是一个全面的评估框架和基准,用于探查多模态模型中的记忆能力,其设计基于认知心理学。实验揭示了在记忆维持、干扰模式和时空定位方面的一致弱点。

0 人收藏 0 人点赞
#multi-modal

通过高维表示学习弥合自然语言与市场动态之间的鸿沟

arXiv cs.LG · 2026-06-01 缓存

本文探讨了在基于Transformer的架构中,用高维FinBERT嵌入替换标量情感得分,用于短期股价预测,结果表明使用Siamese优化嵌入可提高准确性。

0 人收藏 0 人点赞
#multi-modal

WALL-WM:在事件节点上雕琢世界动作建模

Hugging Face Daily Papers · 2026-06-01 缓存

WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。

0 人收藏 0 人点赞
#multi-modal

原生视听对齐生成

Hugging Face Daily Papers · 2026-05-28 缓存

NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。

0 人收藏 0 人点赞
#multi-modal

Slide Deck Q&A 质量保证应用:面向教学问题的多阶段生成流水线

arXiv cs.CL · 2026-05-27 缓存

本文介绍了 slidesqaqa,这是一个基于 Flask 的软件系统,能从 PDF 幻灯片中生成富有教学价值的问题。该系统采用四阶段大语言模型流水线,依次进行文本和图像提取、全幻灯片范围内的问题规划、幻灯片标注以及输出整合,在技术讲座幻灯片上展示了高保真的问题生成能力。

0 人收藏 0 人点赞
#multi-modal

Unveil: 多模态文档检索的统一视觉-文本融合与蒸馏

arXiv cs.CL · 2026-05-26 缓存

Unveil提出了一个用于多模态文档检索的统一视觉-文本嵌入框架,通过知识蒸馏将语义理解从视觉-文本模型转移到纯视觉模型,实现鲁棒且高效的检索。

0 人收藏 0 人点赞
#multi-modal

@Phoenixyin13: 字节Seed 的Cola DLM 与MIT何恺明的ELF 几乎同时发布的研究,确实都在尝试打破离散 Token 的枷锁。 事实上,语言本身的离散性是客观存在的,这两篇论文的核心贡献,是把离散到连续的步骤推迟到了最后一刻。 结合我之前提到的…

X AI KOLs Timeline · 2026-05-23 缓存

讨论字节Seed的Cola DLM与MIT何恺明的ELF两篇论文,它们通过连续扩散范式打破离散Token的限制,实现更优的全局规划和多模态对齐。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈