AVA-Encoder:迈向智能体原生的视频表征学习
摘要
AVA-Encoder 通过基于知识图谱的智能体自编码学习结构化视频表征,能够实现电影级视频生成与推理,同时减少 Token 使用量。
查看缓存全文
缓存时间: 2026/08/13 15:34
论文页面 - AVA-Encoder:迈向智能体原生的视频表示学习
来源:https://huggingface.co/papers/2608.12313
摘要
AVA-Encoder 通过基于知识图谱的智能体自动编码学习结构化视频表示,从而以更少的 token 用量实现电影级视频生成与推理。
创意智能体仍然缺乏从高质量人类影片中学习的有效途径,这限制了它们制作电影级视频的能力。一个关键挑战在于缺少一种结构化的视频表示,它既要忠实于影片内容,又要能直接用于智能体的推理与操作。为了应对这一挑战,我们提出了智能体视频自动编码器(AVA-Encoder),一个用于学习智能体原生视频表示的框架,其核心机制是智能体自动编码。AVA-Encoder 将视频转换为知识图谱(KG)表示,再将其重建回视频。其层级结构与状态节点存储结构化文本,而链接的资源层则保存生成的图像、音频和视频。类型化边以智能体易于理解、查询和编辑的形式,保留这些文本描述与资源之间的关系。视频重建差异驱动了一个文本梯度优化框架,该框架将评估反馈表达为自然语言更新方向,用于外层循环中的独立于数据的编码策略伪训练,以及在测试时内层循环中可选的依赖于数据的 KG 表示精炼。大量实验表明,AVA-Encoder 相较于最强外部基线提升了 20.7 个百分点。在受控的仅策略设置中,其经伪训练的镜头级智能体视频编码器策略也优于精心人工调校的策略,同时系统提示词 token 用量减少了 74.3%。我们发布了完整的 AVA-Encoder 框架、一个可靠的智能体视频重建基准,以及首个高质量影片 KG 表示数据集。
查看 arXiv 页面(https://arxiv.org/abs/2608.12313)查看 PDF(https://arxiv.org/pdf/2608.12313)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12313)
在你的智能体中获取此论文:
hf papers read 2608\.12313
没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用此论文的模型0
没有模型关联此论文
在模型 README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该模型。
引用此论文的数据集0
没有数据集关联此论文
在数据集 README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该数据集。
引用此论文的 Space0
没有 Space 关联此论文
在 Space README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该 Space。
包含此论文的收藏集0
没有收藏集包含此论文
将此论文添加到收藏集(https://huggingface.co/new-collection),即可在此页面关联它。
相似文章
VideoRAE:通过表示自编码器驯服视频基础模型进行生成建模
本文介绍了VideoRAE,一种表示自编码器,它利用冻结的视频基础模型来创建紧凑、可重建且利于生成的视频潜在表示。该模型在UCF-101上取得了最先进的结果,且收敛速度优于其他自编码器。
为什么视频代理模型是下一个前沿——Ethan He, xAI Grok Imagine(98分钟阅读)
来自xAI的Ethan He讨论了为什么视频代理模型是下一个前沿,他认为视频模型从LLM中获取智能,并且视频生成的演变将模仿AI编程,从一次性输出转向多轮规划与执行。
VideoSeeker: 通过原生智能体工具调用激励实例级视频理解
VideoSeeker 引入了一种实例级视频理解的新范式,将智能体推理与视觉提示相结合,通过自动化数据合成和强化学习实现卓越性能,超越了 GPT-4o 和 Gemini-2.5-Pro。
Code2Video: 一个以代码为中心的教育视频生成范式
Code2Video是一个以代码为中心的代理框架,用于生成教育视频,相比直接代码生成,提高了连贯性和可解释性。它包括一个多代理系统和一个新的评估基准。
Avatar V:可规模化的视频参考虚拟化身视频生成
Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。