标签
ProcessThinker 引入了一种实用的后训练流程,无需训练显式的过程奖励模型即可提供步骤级的过程奖励。它利用基于展开的奖励为多模态大语言模型中的多步推理提供密集的信用分配,在视频基准测试上持续提升性能。
来自Meta和卡内基梅隆大学的这篇论文提出了一种多模态视觉-语言模型管道,用于检测社交媒体上的AI生成内容,实现了最先进的性能,并对用户参与度产生了积极的下游影响。
本文提出了一种统一的多模态框架,融合强化学习、高频交易、博弈论方法及跨模态情感分析,用于构建智能金融系统,并声称相比单领域系统有显著提升。
PathPocket是一个多模态AI智能体协同助手,专门用于基于证据的病理学,利用全面的证据语料库和超图,在超过20万个真实病例上超越了现有最先进的方法。
本文提出了一个用于零样本工业缺陷检测的大规模多模态数据集(MMIO),并介绍了改进文本-视觉提示(RTVP)方法,在该基准上取得了最优结果。
介绍了MMIOC-1M,一个用于工业缺陷检测的大规模多模态基准,并提出了RTVPNet,一种精细的文本-视觉提示网络,实现了最先进的性能。
PathoSage 提出了一个三阶段框架,用于病理学多模态推理,该框架将知识检索、证据收集和证据裁决分开,以减少幻觉并处理冲突证据,并包含一个无需训练的 Beta-Bernoulli 经验系统,用于建模工具可靠性。
Az8 Studio 是一个无限画布,带有互联节点,用于多模态 AI 视频管线,支持跨节点的上下文记忆、并行多模型编排以及持久化资产到智能体的工作流。它代表着从线性 AI 工具向空间智能体环境的转变。
本文提出了将多模态多任务联邦基础模型(M3T FedFMs)集成到车辆网络中的愿景,讨论了训练原理、应用场景、挑战以及基于Waymo开放数据集的案例研究。
Open Notebook 是一个开源、注重隐私的 Google NotebookLM 替代品,可本地运行并支持多种 AI 模型,用于研究辅助。
介绍了OmniCap-IF,这是首个用于评估全模态视频字幕生成中指令跟随能力的综合性基准,揭示了格式-内容权衡,并提出了改进的模型和数据集。
指导用户在MacBook 16GB上通过LM Studio和Codex运行Gemma 4 12B多模态本地模型,实现自由使用token。
总结了当前多模态大模型创业的几个主要落地方向,包括游戏AI NPC、企业级多模态Agent、内容生成、具身智能和视觉代码助手等。
M^3Eval是一个全面的评估框架和基准,用于探查多模态模型中的记忆能力,其设计基于认知心理学。实验揭示了在记忆维持、干扰模式和时空定位方面的一致弱点。
本文探讨了在基于Transformer的架构中,用高维FinBERT嵌入替换标量情感得分,用于短期股价预测,结果表明使用Siamese优化嵌入可提高准确性。
WALL-WM 通过使用语义事件作为学习单元而非固定动作块,推进了视频-动作学习,实现了更灵活和可扩展的视觉-语言-动作训练与推理。
NAVA 提出了一种原生视听对齐框架,用于联合音频-视频生成,采用 Align-then-Fuse MMDiT 架构,以 6.3B 参数实现了更好的同步性和可控性。
本文介绍了 slidesqaqa,这是一个基于 Flask 的软件系统,能从 PDF 幻灯片中生成富有教学价值的问题。该系统采用四阶段大语言模型流水线,依次进行文本和图像提取、全幻灯片范围内的问题规划、幻灯片标注以及输出整合,在技术讲座幻灯片上展示了高保真的问题生成能力。
Unveil提出了一个用于多模态文档检索的统一视觉-文本嵌入框架,通过知识蒸馏将语义理解从视觉-文本模型转移到纯视觉模型,实现鲁棒且高效的检索。
讨论字节Seed的Cola DLM与MIT何恺明的ELF两篇论文,它们通过连续扩散范式打破离散Token的限制,实现更优的全局规划和多模态对齐。