AVA-Encoder:迈向智能体原生的视频表征学习

Hugging Face Daily Papers 论文

摘要

AVA-Encoder 通过基于知识图谱的智能体自编码学习结构化视频表征,能够实现电影级视频生成与推理,同时减少 Token 使用量。

创意智能体仍然缺乏从高质量人类电影中学习的有效方式,这限制了它们制作电影级视频的能力。一个关键挑战是缺乏一种结构化的视频表征,既忠实于电影内容,又能直接用于智能体的推理和操作。为了应对这一挑战,我们提出了智能体视频自编码器(Agentic Video Auto-Encoder, AVA-Encoder),一种通过智能体自编码学习智能体原生视频表征的框架。 AVA-Encoder 将视频转换为知识图谱(KG)表征,然后将其重建为视频。其层级节点和状态节点存储结构化文本,同时一个关联的资源层保存生成的图像、音频和视频。类型化边以智能体易于理解、查询和编辑的形式,保留这些文本描述与资源之间的关系。视频重建差异驱动一个文本梯度优化框架,该框架将评估反馈表达为自然语言的更新方向,用于外循环中的数据无关编码策略伪训练(Data-Independent Encoding Policy Pseudo-Training),以及测试时间内循环中可选的数据相关知识图谱表征精炼(Data-Dependent KG Representation Refinement)。 大量实验表明,AVA-Encoder 相比最强外部基线提升了 20.7 个百分点。在受控的仅策略设置中,其伪训练镜头级智能体视频编码器策略也优于经过人工精心调校的策略,同时使用的系统提示 Token 减少了 74.3%。我们发布了完整的 AVA-Encoder 框架、一个可靠的智能体视频重建基准,以及首个高质量电影知识图谱表征数据集。
查看原文
查看缓存全文

缓存时间: 2026/08/13 15:34

论文页面 - AVA-Encoder:迈向智能体原生的视频表示学习

来源:https://huggingface.co/papers/2608.12313

摘要

AVA-Encoder 通过基于知识图谱的智能体自动编码学习结构化视频表示,从而以更少的 token 用量实现电影级视频生成与推理。

创意智能体仍然缺乏从高质量人类影片中学习的有效途径,这限制了它们制作电影级视频的能力。一个关键挑战在于缺少一种结构化的视频表示,它既要忠实于影片内容,又要能直接用于智能体的推理与操作。为了应对这一挑战,我们提出了智能体视频自动编码器(AVA-Encoder),一个用于学习智能体原生视频表示的框架,其核心机制是智能体自动编码。AVA-Encoder 将视频转换为知识图谱(KG)表示,再将其重建回视频。其层级结构与状态节点存储结构化文本,而链接的资源层则保存生成的图像、音频和视频。类型化边以智能体易于理解、查询和编辑的形式,保留这些文本描述与资源之间的关系。视频重建差异驱动了一个文本梯度优化框架,该框架将评估反馈表达为自然语言更新方向,用于外层循环中的独立于数据的编码策略伪训练,以及在测试时内层循环中可选的依赖于数据的 KG 表示精炼。大量实验表明,AVA-Encoder 相较于最强外部基线提升了 20.7 个百分点。在受控的仅策略设置中,其经伪训练的镜头级智能体视频编码器策略也优于精心人工调校的策略,同时系统提示词 token 用量减少了 74.3%。我们发布了完整的 AVA-Encoder 框架、一个可靠的智能体视频重建基准,以及首个高质量影片 KG 表示数据集。

查看 arXiv 页面(https://arxiv.org/abs/2608.12313)查看 PDF(https://arxiv.org/pdf/2608.12313)添加到收藏(https://huggingface.co/login?next=%2Fpapers%2F2608.12313)

在你的智能体中获取此论文:

hf papers read 2608\.12313

没有最新的 CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash

引用此论文的模型0

没有模型关联此论文

在模型 README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该模型。

引用此论文的数据集0

没有数据集关联此论文

在数据集 README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该数据集。

引用此论文的 Space0

没有 Space 关联此论文

在 Space README.md 中引用 arxiv.org/abs/2608.12313,即可在此页面关联该 Space。

包含此论文的收藏集0

没有收藏集包含此论文

将此论文添加到收藏集(https://huggingface.co/new-collection),即可在此页面关联它。

相似文章

Avatar V:可规模化的视频参考虚拟化身视频生成

Hugging Face Daily Papers

Avatar V 是一个生产级框架,用于生成行为可识别的虚拟化身视频,基于完整视频参考,引入稀疏参考注意力和运动表示流,在身份保持和唇形同步方面达到最先进水平。