visual-rag

标签

Cards List
#visual-rag

@GYLQ520: PixelRAG 来自伯克利 SkyLab 等团队,开源可玩。 它的思路很直接,不再靠 HTML 或文本解析,而是把网页、PDF 直接截成截图,用视觉索引做 RAG 检索。 表格、图表、布局这些 HTML 解析会丢掉的东西,全保留下来了。…

X AI KOLs Timeline ↗ · 2026-08-21 缓存

PixelRAG 是来自伯克利SkyLab等团队的开源项目,通过将网页和PDF截图为截图并用视觉索引进行检索,提高RAG准确率并显著降低AI Agent的token成本。

0 人收藏 0 人点赞
#visual-rag

Does More Retrieved Evidence Help Visual Retrieval-Augmented Generation with Diffusion Language Models?

arXiv cs.CL ↗ · 2026-08-10 缓存

The paper investigates whether retrieving more evidence helps visual retrieval-augmented generation with diffusion language models, finding that unconditionally expanding evidence hurts accuracy due to semantic conflict, and proposes a training-free Entropy-Based Candidate Filter (ECF) to selectively admit evidence, improving accuracy across benchmarks.

0 人收藏 0 人点赞
#visual-rag

UniDoc-RL:基于层次化动作与密集奖励的粗到细视觉RAG

Hugging Face Daily Papers ↗ · 2026-04-16 缓存

UniDoc-RL 提出了一种面向大型视觉-语言模型的强化学习框架,通过层次化决策与密集多奖励监督来优化检索、重排序和视觉推理,在视觉RAG任务上相较此前基于RL的方法实现了高达17.7%的性能提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈