PRISM: 程序化时空推理基准
摘要
PRISM是一个大规模基准,包含10,372个人工校准的指令-代码对,用于评估程序化视频生成,并采用了一个漏斗式框架,包含四个指标。对七个大型语言模型的评估揭示了代码可执行性与空间一致性之间存在显著差距。
arXiv:2605.19382v1 公告类型: 新\n摘要: 通过代码进行程序化视频生成提供了超越像素级扩散模型的几何精度和时间一致性,但严格评估语言模型能否生成空间正确的动画输出仍是一个未解决的问题。我们提出了PRISM,一个大规模基准,包含10,372个人工校准的指令-代码对(比之前的程序化视频生成基准大20倍),基于英语和中文的实际知识可视化场景,涵盖437个主题类别。我们进一步提出了一个漏斗式评估框架,包含四个互补指标:Code-Level Reliability用于可执行性,Spatial Reasoning用于整个动画序列的布局正确性,以及Prompt-Aware Dynamic Visual Complexity (PADVC)和Temporal Density (TD)用于诊断动态表达和时间活动。对七个主流大型语言模型的系统评估揭示了一个显著的执行-空间差距:从执行成功率到空间通过率的平均下降约为41%,表明可运行的代码不一定产生空间一致的视觉输出。这些发现表明,程序化视频生成评估应超越可执行性。PRISM为推进空间一致的代码生成提供了一个原则性的基准。
查看缓存全文
缓存时间: 2026/05/20 08:29
# PRISM:程序化时空推理基准 来源:https://arxiv.org/abs/2605.19382 作者:Qiran Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+Q),Yuheng Wang (https://arxiv.org/search/cs?searchtype=author&query=Wang,+Y),Runde Yang (https://arxiv.org/search/cs?searchtype=author&query=Yang,+R),Lin Wu (https://arxiv.org/search/cs?searchtype=author&query=Wu,+L),Jingru Fan (https://arxiv.org/search/cs?searchtype=author&query=Fan,+J),Shu Yao (https://arxiv.org/search/cs?searchtype=author&query=Yao,+S),Jie Zhang (https://arxiv.org/search/cs?searchtype=author&query=Zhang,+J),Tianle Zhou (https://arxiv.org/search/cs?searchtype=author&query=Zhou,+T),Huatao Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+H),Ruijie Shi (https://arxiv.org/search/cs?searchtype=author&query=Shi,+R),Yihan Li (https://arxiv.org/search/cs?searchtype=author&query=Li,+Y),Chen Qian (https://arxiv.org/search/cs?searchtype=author&query=Qian,+C) 查看PDF (https://arxiv.org/pdf/2605.19382) > 摘要:通过代码进行程序化视频生成,能够提供超越像素级扩散模型的几何精度与时间连贯性,但如何严格评估语言模型是否能生成空间正确的动画输出,仍是一个开放性问题。我们提出 PRISM,一个包含 10,372 个人工校准指令-代码对的大规模基准(比此前程序化视频生成基准大 20 倍),基于英文和中文的真实世界知识可视化场景,涵盖 437 个主题类别。我们进一步提出漏斗式评估框架,包含四个互补指标:用于可执行性的代码级可靠性、用于完整动画序列布局正确性的空间推理、以及用于诊断动态表达和时间活动的提示感知动态视觉复杂度 (PADVC) 和时间密度 (TD)。对七个主流 LLM 的系统评估揭示了一个显著的执行-空间差距:从执行成功率到空间通过率的平均下降约为 41%,表明可运行代码不一定能产生空间连贯的视觉输出。这些发现表明,程序化视频生成评估应超越可执行性。PRISM 为推动空间连贯代码生成提供了原则性基准。 ## 提交历史 来自:Yuheng Wang [查看邮件 (https://arxiv.org/show-email/cfcf7edd/2605.19382)] **\[v1\]** 2026年5月19日 星期二 05:28:54 UTC (2,454 KB)
相似文章
PRISM:用于顺序决策的感知与推理交织方法
本文介绍了 PRISM,这是一个通过动态问答流程整合视觉-语言模型和大语言模型的框架,旨在提升具身 AI 任务中的顺序决策能力。
PRISM:通过结构化多模态数据合成实现优先级感知的规则内化
本文介绍了PRISM,一个用于训练多模态大语言模型遵循优先级规则的四阶段数据合成框架,以及PRISM-Eval,一个无需评判者的评估套件。仅用10K样本,PRISM就将Qwen3-VL-4B在PRISM-Eval上的严格准确率从9.5%提升到30.1%,同时保持了通用基准性能,并且这些提升可迁移到其他开源多模态大语言模型。
PRISM:探究大语言模型幻觉中的推理、指令与源记忆
研究人员提出了 PRISM 诊断基准,该基准将大语言模型(LLM)的幻觉拆解为四个维度(知识缺失/错误、推理错误、指令遵循错误),涵盖三个生成阶段(记忆、指令、推理),并通过评估 24 款大语言模型,揭示了各类缓解策略之间存在的权衡关系。
PRISM:面向共情口语对话的韵律集成多智能体推理框架
PRISM 是一个多智能体框架,通过将语音感知、响应生成和语音合成解耦,并结合韵律线索与大语言模型推理及外部知识工具,以提升共情口语对话的质量。
PRISM:一种将漂移分解为尺度、形状和头部的几何风险界
本文介绍了 PRISM,这是一种几何风险界,将训练后大型语言模型(LLM)变体中的模型漂移分解为尺度、形状和头部三个维度,以诊断量化误差或灾难性遗忘等特定故障模式。