multi-modal

标签

Cards List
#multi-modal

TheBioCollection: 统一的生物学预训练规模大语言模型语料库

arXiv cs.AI · 2026-07-13 缓存

TheBioCollection是一个526亿令牌的生物学预训练语料库,它将异构资源整合为统一格式以训练大型语言模型,并包含配套的评估套件。在该语料库上训练,生物学基准测试的整体得分提高了一倍以上,同时保持通用语言能力几乎不变。

0 人收藏 0 人点赞
#multi-modal

@AdinaYakup: SenseNova-Vision 商汤科技的新模型将所有计算机视觉视为生成任务 - 7B - CC BY-NC 4.0 (非商业性…

X AI KOLs Following · 2026-07-08 缓存

商汤科技发布了SenseNova-Vision,这是一个7B参数的模型,将所有计算机视觉任务统一为生成任务,并提供了开放权重、指令语料库、基准、论文和演示。

0 人收藏 0 人点赞
#multi-modal

将交错多模态推理桥接为统一决策过程

arXiv cs.AI · 2026-07-07 缓存

BRAID是一个框架,它将交错文本-图像-文本推理形式化为统一的马尔可夫决策过程,通过强化学习实现文本和视觉生成的联合优化,并由VLM裁判提供密集的轮次级反馈。

0 人收藏 0 人点赞
#multi-modal

多模态铁路道口安全分析

arXiv cs.LG · 2026-07-03 缓存

本文提出了一种概念验证型AI流水线,利用多模态数据(图像和事故报告)评估铁路道口安全,在风险分类上实现了0.757的宏F1分数,并通过微调紧凑型VLM在安全评分估算上达到了0.078的RMSE。

0 人收藏 0 人点赞
#multi-modal

nvidia/Cosmos3-Edge

Hugging Face Models Trending · 2026-07-01 缓存

NVIDIA 发布了 Cosmos3-Edge,这是一个全模态世界基础模型,能够从文本、图像、视频和动作轨迹输入生成视频、图像、音频和动作命令,面向机器人、自动驾驶和智能空间等物理 AI 应用。

0 人收藏 0 人点赞
#multi-modal

HealthAgentBench: 面向前沿AI智能体的统一真实医疗智能体环境基准套件

arXiv cs.AI · 2026-07-01 缓存

本文介绍了HealthAgentBench,一个包含54个真实医疗任务的套件,用于评估前沿AI智能体。研究发现,即使是最强的智能体(Codex GPT-5.5)也仅能达到约42%的成功率,凸显了巨大的改进空间。

0 人收藏 0 人点赞
#multi-modal

多模态图社交媒体流行度预测基准测试

arXiv cs.AI · 2026-06-29 缓存

本文介绍了MMG-Pop,一个用于多模态图社交媒体流行度预测的统一基准,并提出了MMG-PopNet,该模型联合建模多模态内容和时间社交互动。在Bluesky和Reddit数据集上的实验展示了优越的性能,并提供了跨平台泛化和多任务预测的见解。

0 人收藏 0 人点赞
#multi-modal

HARMES数据集上多模态人体活动识别融合技术的比较

arXiv cs.LG · 2026-06-29 缓存

本文系统比较了HARMES数据集上七种最先进的传感器融合方法用于多模态人体活动识别,结果表明门控多模态融合取得了最高的宏F1分数0.82,比基线提高了6个百分点。

0 人收藏 0 人点赞
#multi-modal

谷歌的 NotebookLM Pro 版每月收费 19.99 美元。这款开源替代方案完全免费提供无限访问权限。零订阅…

X AI KOLs Timeline · 2026-06-27 缓存

一款谷歌 NotebookLM 的开源替代方案,提供免费无限访问权限,本地运行,采用 MIT 许可,并具备播客生成、多模态导入等功能。

0 人收藏 0 人点赞
#multi-modal

@oliviscusAI: 微软开源了一个系统,让一个AI控制数百个其他AI模型。它叫做JARVIS。• 处理文本…

X AI KOLs Timeline · 2026-06-26 缓存

微软开源了JARVIS,该系统使用GPT控制器编排来自HuggingFace的数百个AI模型,用于多模态任务。

0 人收藏 0 人点赞
#multi-modal

OmniPath:用于审计轮椅无障碍性的多模态代理框架

arXiv cs.AI · 2026-06-24 缓存

OmniPath是一个多模态代理框架,结合了OpenStreetMap网络拓扑与航空LiDAR数据,通过高分辨率分析坡度、表面不连续等物理障碍来审计轮椅无障碍性,并经过实地调查验证。

0 人收藏 0 人点赞
#multi-modal

IV-CoT: 隐式视觉思维链用于结构感知的文本到图像生成

Hugging Face Daily Papers · 2026-06-23 缓存

IV-CoT 将视觉条件分解为结构和语义级联,以改进结构感知的图像生成,使用仅训练阶段的草图监督来指导结构查询。在 GenEval 和 T2I-CompBench 上达到了最先进的结果。

0 人收藏 0 人点赞
#multi-modal

ChartWalker:跨图表RAG任务基准测试

Hugging Face Daily Papers · 2026-06-22 缓存

ChartWalker 提出了一种新颖的跨图表检索增强生成(RAG)框架,采用分层知识图谱构建和结构感知采样。它发布了一个具有挑战性的基准测试(ChartWalker-Bench)和一个智能体基线(ChartWalker-Agent),揭示了当前RAG范式中的显著性能差距。

0 人收藏 0 人点赞
#multi-modal

@mervenoyann:这条管线的第二天发现 > 它有效,在道路标志检测中针对人工标注得到了 map@50=0.8028,使用了……

X AI KOLs Timeline · 2026-06-17 缓存

Merve (@mervenoyann) 分享了使用多个小型 VLM 作为评判器的管线的第二天发现,在道路标志检测中仅用 1.3k 样本就达到了 map@50=0.8028。这条推文比较了模型拒绝率,讨论了数据集缩小、超具体提示以及泛化该库的计划。

0 人收藏 0 人点赞
#multi-modal

QoS感知的令牌调度与多模态智能体网络的私有数据估值

arXiv cs.AI · 2026-06-16 缓存

本研究论文提出了一种面向去中心化多模态智能体系统的公平令牌分配和私有数据估值框架,利用差分隐私原型在调度有限的边缘AI资源的同时平衡隐私与效用。

0 人收藏 0 人点赞
#multi-modal

@mishig25: 开源真的回来了 http://hf.co/mistralai/Mistral-Medium-3.5-128B…

X AI KOLs Following · 2026-06-15 缓存

Mistral AI发布了Mistral Medium 3.5,这是一个开源的128B稠密模型,支持256k上下文、多模态输入、可配置推理和智能体能力。

0 人收藏 0 人点赞
#multi-modal

LLM Gateway Chat

Product Hunt · 2026-06-15

LLM Gateway Chat 是一个平台,提供对多种AI模型的访问,用于聊天、图像、视频和音频生成。

0 人收藏 0 人点赞
#multi-modal

PermaVid: 通过解耦上下文记忆实现编辑间一致的视频生成

Hugging Face Daily Papers · 2026-06-15 缓存

PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。

0 人收藏 0 人点赞
#multi-modal

@PyTorch: 在他的PyTorch Conference Europe 2026主题演讲中,Patrick von Platen (@MistralAI)讨论了为什么现实世界的……

X AI KOLs Following · 2026-06-12 缓存

在PyTorch Conference Europe 2026上,Mistral AI的Patrick von Platen解释了为什么现实世界的AI交互需要能够处理连续输入并产生连续输出的流式架构,并以Vox Real Time作为实时转录示例。

0 人收藏 0 人点赞
#multi-modal

面向配电缺陷检测的多模态智能体:基础模型评估

arXiv cs.AI · 2026-06-12 缓存

本文提出了一种用于配电缺陷检测的多模态智能体框架,评估了基础模型在感知、推理和工具使用能力方面的表现,并提供了新的领域特定数据集和基准。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈