虚构世界构建:基于分层上下文压缩与迭代审核的多智能体LLM协作

arXiv cs.AI 论文

摘要

本文介绍了AutoWorldBuilder,一个用于自动化虚构世界构建的多智能体LLM系统。该系统通过分层上下文压缩、基于DAG的调度和迭代审核,解决了上下文爆炸、创意多样性和质量保证问题,实现了95%的成功率,并每个世界生成了56-103个自洽概念。

arXiv:2607.09403v1 公告类型:新 摘要:世界构建,即构建连贯的虚构世界,是游戏设计和文学创作中的基础任务。大型语言模型(LLM)为自动化内容生成提供了新的可能性,但其在世界构建中的应用面临三大挑战:随构建过程线性增长的上下文爆炸、创意多样性与内容一致性之间的张力,以及缺乏自动化质量保证。本文介绍了AutoWorldBuilder,一个多智能体协作系统,通过五个集成组件解决这些挑战:带有冲突检测的结构化概念网络;基于DAG的混合批处理调度器,按语义局部性分组任务;实现约90% token缩减的四层上下文压缩机制;带有专用审计智能体的迭代审核系统,将提案通过率从42%提高到85%以上;以及支持零代码扩展、具有差异化温度配置的技能驱动智能体架构。在20个多样化的世界构建任务上进行了两次实验,使用GPT-OSS 120B和DeepSeek v3.2作为LLM后端,展示了95.0%的成功率。该系统在18-31分钟内每个世界生成了56-103个自洽概念,且零冲突交付。这里验证的架构模式,包括层即预算压缩、语义局部性调度以及生成与审核分离,可迁移到更广泛的知识密集型多智能体LLM应用。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:53

# 虚构世界构建:基于分层上下文压缩与迭代评审的多智能体大模型协作机制  
**来源:** https://arxiv.org/html/2607.09403 \\JAIRAE\\JAIRTrack  

###### 摘要  
世界构建(Worldbuilding)作为构建连贯虚构世界的基础性任务,在游戏设计与文学创作中占据核心地位。大语言模型(LLMs)为自动化内容生成开辟了新可能,但其在世界构建任务中的应用面临三大挑战:随构建过程线性增长的上下文爆炸问题、创造性多样性与内容一致性之间的张力、以及自动化质量保证机制的缺失。本文提出AutoWorldBuilder,一个通过五个集成组件应对上述挑战的多智能体协作系统:一个带有冲突检测的结构化概念网络;一个基于DAG的混合批处理调度器,按语义局部性对任务进行分组;一个实现约90%令牌缩减的四层上下文压缩机制;一个配备专业审计Agent的迭代评审系统,将提案通过率从42%提升至85%以上;以及一个支持零代码扩展并具备差异化温度配置的技能驱动Agent架构。在20个多样化世界构建任务中,以GPT-OSS 120B和DeepSeek v3.2作为LLM后端的两项实验表明,该系统成功率达到95.0%。系统在18-31分钟内为每个世界生成56-103个自洽概念,且评审流水线未发现任何冲突。本系统验证的架构模式——包括分层预算压缩、语义局部性调度以及生成与评审分离——可迁移至更广泛的知识密集型多智能体LLM应用场景。  
††copyright:cc ††doi:10.1613/jair.1.xxxxx ††journalvolume:4 ††article:6 ††publicationmonth:8 ††journalyear:2026  

## 1. 引言  

### 1.1. 背景与动机  
世界构建,即构建连贯的虚构世界,是创意内容生产中的基础性任务,涉及游戏设计、文学创作、影视制作以及桌面角色扮演游戏(TRPG)等领域。一个完整、自洽的虚构世界通常涵盖地理、智慧种族、魔法或科技体系、社会组织、历史事件、文化习俗等多个维度,包含数十到数百个相互关联的概念。例如,《指环王》中的中土世界包含超过2000个命名地点和角色;《冰与火之歌》中的维斯特洛大陆同样拥有一套完整的地理、历史、贵族家族和神话体系。这些世界不仅为叙事提供丰富背景,更成为作品吸引力的核心来源。  

然而,传统人工世界构建在效率和质量方面均面临重大挑战。据游戏行业调查,一款中型开放世界游戏(如《巫师3:狂猎》)的设定文档通常超过50万字,需要5-10人的世界构建团队协作6-12个月。在此过程中,设计团队必须持续维护概念一致性,协调不同设计师的领域分工,并确保整体风格统一。这些努力成本高昂,且容易导致概念碎片化——各子系统独立演化而缺乏有机整合。  

大语言模型(LLMs)的出现为自动化内容生成开辟了新路径。GPT-4、Claude[^1]和Gemini[^2]等模型在创意写作任务中展现出强大的生成能力。然而,在将单一LLM直接应用于复杂世界构建任务时,我们观察到三项根本性的技术挑战,这些挑战构成了本文的核心研究问题。  

### 1.2. 核心技术挑战  
**挑战一:上下文爆炸**  
世界构建是一个增量式过程。生成后续概念时,需要引用已完成的概念以确保一致性。假设一个世界最终包含 N 个概念,每个概念平均需要 M 个令牌来描述,则总上下文大小约为 N × M。当 N=100、M=500 时,总令牌需求达到50000;若 N 增长至500,需求将飙升到250000令牌,远超当前主流LLM的128K上下文窗口限制。研究[^3]已发现LLM在处理长上下文时存在“迷失在中间”(Lost in the Middle)现象——模型对文档中间部分信息的回忆准确率显著低于开头和结尾。这意味着,即使上下文窗口勉强能容纳所有历史概念,模型也难以有效利用这些信息。长上下文还会带来高昂的API调用成本和推理延迟,使其在需要数百次迭代的构建任务中代价过高。现有的检索增强生成(RAG)方法[^4]通过检索相关段落来缓解上下文压力,但简单的关键词匹配无法捕捉概念之间的隐式语义关联。例如,在生成“龙骑士训练场”时,系统需要理解其与“龙族”、“骑士团”、“魔法学院”等概念的关系,而不仅仅是检索包含关键词“龙骑士”的文档。  

**挑战二:创造性多样性与逻辑一致性之间的张力**  
世界构建既要求创造性多样性,也需要内部一致性。多样性意味着每个精灵种族不应只是托尔金笔下精灵的翻版;一致性则意味着第一章建立的魔法体系规则在第十章仍然成立。这两个目标本质上相互矛盾。引入多个专业Agent并行生成内容是应对多样性的自然方法。然而,多Agent并行会带来新的协调挑战。在实践中,我们观察到:(1)风格碎片化——科幻设计师的“量子传送门”与奇幻设计师的“魔法传送阵”在同一世界中共存;(2)概念冲突——地理设计师定义“精灵居住于北部森林”,而种族设计师生成“精灵王国位于南部沙漠”;(3)信息孤岛——Agent无法感知彼此的产出,导致概念重复或关键依赖缺失。简单地提高生成温度可以增强多样性,但会加剧一致性问题;降低温度能提升稳定性,却导致产出同质化。这迫切需要一种既能激发多样化创意、又能确保全局一致性的架构机制。  

**挑战三:自动质量检测与保证**  
对LLM生成内容进行质量控制是一个开放性挑战。传统的“人工审核”在自动化构建场景中不切实际——如果系统在18分钟内生成100个概念,人工逐一审核需要数小时。然而,仅依赖LLM自我评估存在“自我批准偏差”(Self-Approval Bias)[^5]问题——模型即使存在明显逻辑问题,也倾向于给自己的输出打高分。世界构建还涉及多个专业领域的知识,单一模型无法拥有所有相关的专家判断能力。冲突检测需要跨概念的全景视角。例如,“精灵寿命500年”和“精灵王国仅建立100年”单独看都没有问题,但结合起来就构成逻辑矛盾。现有的宪法AI(Constitutional AI)方法[^6]通过预设规则约束生成行为,但世界构建的“规则”难以事先穷举——奇幻世界的魔法规则与科幻世界的科技原理本质不同,需要在构建过程中动态学习和检测。  

### 1.3. 研究目标  
上述三项挑战相互关联:不恰当的上下文管理会加剧一致性问题,一致性检测不足会削弱质量保证,而质量保证机制本身又可能引入额外的上下文开销。因此,我们提出一个核心研究问题:  
> **如何设计一个多智能体协作系统,在实现LLM驱动的自动化世界构建的同时,确保生成质量与一致性?**  

解决此问题需要系统性创新,而非对个别技术的渐进式改进。具体而言,我们确立以下研究目标:  
**RO1 上下文效率:** 设计一种分层上下文管理机制,在保留关键信息的前提下将令牌消耗降低一个数量级(目标压缩比>90%),使系统能在主流LLM的上下文限制内完成大规模世界构建。  
**RO2 并行协调:** 设计一种既能确保概念间依赖完整性(子概念在父概念之后生成)、又能最大化并行效率(独立任务并发执行)的任务调度策略,同时提供Agent间的信息隔离以防止风格污染。  
**RO3 质量保证:** 设计一种结合通用质量评分与领域专家评估的多层评审机制,在不依赖人工干预的情况下将概念通过率提升至可接受水平(目标>80%),并确保最终输出中无冲突被检测到。  
**RO4 系统可扩展性:** 设计一种灵活的多Agent架构,支持零代码添加新的专业Agent以适应不同世界构建类型(奇幻、科幻、历史等),为未来研究提供可复用的技术基础。  

尽管世界构建是具体测试场景,但这些目标所解决的问题并非创意写作所独有。渐进式的知识积累、多样性与一致性之间的张力、以及自动化质量保证——这些问题在代码生成、科学写作和教育内容生产中反复出现。因此,本文开发的方法不仅评估其在特定领域的性能,也考察其对更广泛知识密集型LLM应用的可迁移性。  

### 1.4. 研究贡献  
基于上述研究目标,本文设计并实现了AutoWorldBuilder——一个由LLM驱动的多智能体协作世界构建系统。主要贡献如下:  

**贡献一:结构化概念网络模型。**  
整合ConceptNet关系分类体系[^7]和SenticNet常识知识表示框架[^8],我们设计了一个专用于虚构世界构建的结构化概念网络。该模型定义了16种语义关系类型(涵盖层次、属性、功能、事件、因果和语义六大类别),并为每种关系定义了逆关系和传递性约束。基于该模型,我们设计了五类冲突检测算法:循环检测、一对多矛盾检测、概念定义冲突检测、时空设定冲突检测和风格冲突检测。需要指出的是,在当前实验中,关系解析模块尚未完全激活(参见6.4节局限一),因此概念网络仅存储节点而无边,冲突检测仅运行所设计算法的一个子集。尽管如此,完整的正式模型为知识存储和一致性维护提供了蓝图。超越世界构建领域,该模型可能为任何需要在一组不断增长的生成实体之间维持关系一致性的LLM系统提供通用方法。  

**贡献二:基于DAG的混合批处理任务调度策略。**  
我们将世界构建任务建模为有向无环图(DAG),并提出一种融合依赖优先级、语义局部性和批量大小控制的三维混合分区算法。该算法通过Kahn算法确保依赖完整性,并基于语义标签对同层任务进行分组。通过智能合并与拆分,批量大小维持在预设范围内(默认每批2-10个任务),在保持依赖完整性的同时,通过上下文复用提高生成效率。语义局部性维度是方法论上的创新元素:通过将共享领域上下文的任务分组,调度器实现了跨同批Agent的上下文复用,这一策略可能适用于多步骤代码生成和模块化文档撰写。  

**贡献三:四层上下文压缩机制。**  
我们提出一种按功能层分配令牌预算的压缩策略,将上下文划分为必需层(约20%)、相关层(约35%)、摘要层(约20%)和协作层(约25%)。结合FAISS向量检索[^9]进行语义召回,并通过批过滤器以及基于6×6兼容性矩阵的Agent兼容性过滤器进一步优化,该机制在精简模式下实现了89.9%的压缩效率,每次LLM调用平均仅使用304个令牌。这种“分层预算”方法——每个功能类别获得专用配额而非争夺单一池——可能泛化到任何LLM Agent需要在固定上下文窗口内运行同时引用不断演化的知识库的场景。  

**贡献四:迭代评审与专业化审计Agent系统。**  
我们设计了一种模拟专家小组评审的多层质量保证机制:LLM五维评分(一致性权重最高,设为1.5)结合8个专门化Agent的并行评估。未通过的提案进入修改-重新评估的迭代循环,最终输出通过Top-K过滤(默认取前70%)选定。实验表明,该机制将提案通过率从第一轮的42%提升至85.5%,且最终输出中审计系统未标记任何冲突。审计Agent在架构上独立于生成Agent,缓解了文献[^5]记载的自我批准偏差问题。这种“生成与评审分离”的原则适用于任何需要自动化质量把关而不依赖人工干预的LLM输出场景。  

**贡献五:技能驱动的多Agent架构。**  
我们设计了一种可配置、零代码的Agent扩展方案。每个Agent的行为由独立的Markdown文件定义(YAML Frontmatter元数据 + Markdown系统提示词)。AgentSkillLoader动态扫描并解析技能文件,允许在不修改代码的情况下添加新Agent。该架构支持差异化的温度配置(奇幻:0.9 / 地理:0.3 / 种族:0.7)和一个6×6兼容性矩阵以控制信息可见性,在实验中成功支持21个Agent的动态协调。其核心洞见——创意任务与事实性任务在同一流水线中需要根本不同的解码参数——提供了一种可复用的设计模式。  

[^1]: 见https://arxiv.org/html/2607.09403#bib.bib4  
[^2]: 见https://arxiv.org/html/2607.09403#bib.bib18  
[^3]: 见https://arxiv.org/html/2607.09403#bib.bib27  
[^4]: 见https://arxiv.org/html/2607.09403#bib.bib25  
[^5]: 见https://arxiv.org/html/2607.09403#bib.bib28  
[^6]: 见https://arxiv.org/html/2607.09403#bib.bib5  
[^7]: 见https://arxiv.org/html/2607.09403#bib.bib41  
[^8]: 见https://arxiv.org/html/2607.09403#bib.bib7  
[^9]: 见https://arxiv.org/html/2607.09403#bib.bib22

相似文章

无限世界与多样交互

Hugging Face Daily Papers

本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。