multimodal-qa

标签

Cards List
#multimodal-qa

DeAR:通过能力锚定与协作思维导航的分散式代理推理

arXiv cs.AI · 2026-08-19 缓存

DeAR是一个分散式代理推理框架,通过能力锚定与协作思维导航,在知识密集型推理任务中提升准确性,在多模态基准测试上优于集中式方法。

0 人收藏 0 人点赞
#multimodal-qa

重排器所见:面向长文档多模态问答的多维度页面标注

arXiv cs.AI · 2026-08-18 缓存

本文提出Trident方法,通过结构化的多维度页面标注,增强长文档视觉问答中的重排与综合环节,从而提升证据选择与答案生成的准确性。

0 人收藏 0 人点赞
#multimodal-qa

CLIR-Bench:不规则临床时间序列的多模态问答基准

arXiv cs.CL · 2026-07-14 缓存

CLIR-Bench是一个针对不规则采样临床时间序列的多模态问答基准,基于ICU记录构建,包含跨越11个临床变量的6,600个问答实例。它揭示了现有通用模型在处理稀疏时间证据方面的困难,突显了开发更强的不规则时间序列推理方法的必要性。

0 人收藏 0 人点赞
#multimodal-qa

PhysBrain 1.0 技术报告

Hugging Face Daily Papers · 2026-05-14 缓存

PhysBrain 1.0 是一份技术报告,提出了一种利用人类自我中心视频为视觉-语言-动作模型生成物理常识监督的方法,在ERQA、PhysBench、SimplerEnv-WidowX、LIBERO和RoboCasa等具身控制基准上取得了最先进的结果。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈