标签
TheBioCollection是一个526亿令牌的生物学预训练语料库,它将异构资源整合为统一格式以训练大型语言模型,并包含配套的评估套件。在该语料库上训练,生物学基准测试的整体得分提高了一倍以上,同时保持通用语言能力几乎不变。
商汤科技发布了SenseNova-Vision,这是一个7B参数的模型,将所有计算机视觉任务统一为生成任务,并提供了开放权重、指令语料库、基准、论文和演示。
BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。
本文提出了一种概念验证型AI流水线,利用多模态数据(图像和事故报告)评估铁路道口安全,在风险分类上实现了0.757的宏F1分数,并通过微调紧凑型VLM在安全评分估算上达到了0.078的RMSE。
NVIDIA 发布了 Cosmos3-Edge,这是一个全模态世界基础模型,能够从文本、图像、视频和动作轨迹输入生成视频、图像、音频和动作命令,面向机器人、自动驾驶和智能空间等物理 AI 应用。
本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。
本文介绍了MMG-Pop,一个用于多模态图社交媒体流行度预测的统一基准,并提出了MMG-PopNet,该模型联合建模多模态内容和时间社交互动。在Bluesky和Reddit数据集上的实验展示了优越的性能,并提供了跨平台泛化和多任务预测的见解。
本文系统比较了HARMES数据集上七种最先进的传感器融合方法用于多模态人体活动识别,结果表明门控多模态融合取得了最高的宏F1分数0.82,比基线提高了6个百分点。
一款谷歌 NotebookLM 的开源替代方案,提供免费无限访问权限,本地运行,采用 MIT 许可,并具备播客生成、多模态导入等功能。
微软开源了JARVIS,该系统使用GPT控制器编排来自HuggingFace的数百个AI模型,用于多模态任务。
OmniPath是一个多模态代理框架,结合了OpenStreetMap网络拓扑与航空LiDAR数据,通过高分辨率分析坡度、表面不连续等物理障碍来审计轮椅无障碍性,并经过实地调查验证。
IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。
ChartWalker 提出了一种新颖的跨图表检索增强生成(RAG)框架,采用分层知识图谱构建和结构感知采样。它发布了一个具有挑战性的基准测试(ChartWalker-Bench)和一个智能体基线(ChartWalker-Agent),揭示了当前RAG范式中的显著性能差距。
Merve (@mervenoyann) 分享了使用多个小型 VLM 作为评判器的管线的第二天发现,在道路标志检测中仅用 1.3k 样本就达到了 map@50=0.8028。这条推文比较了模型拒绝率,讨论了数据集缩小、超具体提示以及泛化该库的计划。
本研究论文提出了一种面向去中心化多模态智能体系统的公平令牌分配和私有数据估值框架,利用差分隐私原型在调度有限的边缘AI资源的同时平衡隐私与效用。
Mistral AI发布了Mistral Medium 3.5,这是一个开源的128B稠密模型,支持256k上下文、多模态输入、可配置推理和智能体能力。
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。
在PyTorch Conference Europe 2026上,Mistral AI的Patrick von Platen解释了为什么现实世界的AI交互需要能够处理连续输入并产生连续输出的流式架构,并以Vox Real Time作为实时转录示例。
本文提出了一种用于配电缺陷检测的多模态智能体框架,评估了基础模型在感知、推理和工具使用能力方面的表现,并提供了新的领域特定数据集和基准。