multimodal-agent

标签

Cards List
#multimodal-agent

VaseMuseum:古希腊陶器数字智能博物馆

Hugging Face Daily Papers · 2026-07-07 缓存

本文提出VaseMuseum,一个轻量级多模态智能体框架,将3D数字化与视觉语言模型相结合,为古希腊陶器创建交互式数字博物馆,通过源级和响应级可靠性控制解决证据基础与幻觉问题。

0 人收藏 0 人点赞
#multimodal-agent

CanvasAgent: 通过视觉工具编排实现复杂图像创建与编辑

Hugging Face Daily Papers · 2026-07-06 缓存

本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。

0 人收藏 0 人点赞
#multimodal-agent

Light-Omni:带长期记忆的智能体视频理解中反射优先于推理

Hugging Face Daily Papers · 2026-07-06 缓存

Light-Omni是一个多模态智能体框架,用于高效视频理解,通过双上下文状态(全局状态和参数化潜在状态)避免迭代推理,实现更快更准确的处理,并显著提升速度和节省内存。

0 人收藏 0 人点赞
#multimodal-agent

Visual-Seeker: 通过主动视觉推理实现视觉原生多模态代理搜索

arXiv cs.AI · 2026-06-16 缓存

Visual-Seeker 提出了一种视觉原生多模态深度搜索代理,它主动推理细粒度视觉细节并综合多模态证据,在五个具有挑战性的多模态搜索基准上实现了最先进的性能。

0 人收藏 0 人点赞
#multimodal-agent

VisualClaw: 面向物理世界的实时个性化智能体

Hugging Face Daily Papers · 2026-06-15 缓存

VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。

0 人收藏 0 人点赞
#multimodal-agent

@MaxForAI: 昨天字节Seed开源了一个非常有意思的checkpoint TaskMem 它基于Qwen3-VL-30B-A3B训练,目标不是直接回答问题,而是让多模态Agent在视频/环境流里学会生成更有用的长期记忆。 重点是让Agent学会在连续视…

X AI KOLs Timeline · 2026-06-03 缓存

字节Seed开源了TaskMem checkpoint,基于Qwen3-VL-30B-A3B训练,通过两阶段强化学习让多模态Agent在视频流中学会生成长期记忆,在VideoMME、EgoLife等基准上获得显著提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈