阅读结构,写作散文:多智能体文档生成中的非对称结构条件
摘要
本文评估了一个用于正式投标响应的已部署多智能体系统,证明其在评估中达到了与人类相当的质量,并强调了其中的非对称性:结构化标记有助于阅读,但无助于写作。
arXiv:2608.20786v1 公告类型:新
摘要:编写正式文档的多智能体流程必须既读取请求者的表格,又依据其进行撰写。我们报告了一个已部署的投标响应系统,该系统在主权约束下运行一个开放权重模型,并将其与同一组织实际提交的人工撰写的投标书进行了对比评估。在一次盲评中(系统无法参考任何已处理的样例),一位LLM评审员在55个标准答案章节中的至少40个里,将该系统的回答评定为与人工提交的回答同样好,4个更好,无一缺失,并仅标记了一个无依据的主张。对评审员指出的每一个差距进行分类显示,68%的内容缺失源自系统自身来源之外——是人工撰写者掌握而该流程从未获得的信息——因此,15个不利判定中只有6个涉及系统本可以避免的缺陷。与标准答案的分歧更常是信息可用性的结果,而非写作质量的结果,不区分这两者的评估低估了此类系统的能力。在此背景下,我们报告了一种条件设置的非对称性。众所周知,将文档渲染为结构化标记而非纯文本散文可提高信息提取能力,我们在三项阅读任务中也复现了这一结论。但这种益处并不适用于条件设置:将投标的*指令*材料从散文格式转换为嵌套XML格式,使答案质量在配对比较中从74%下降到48%。我们进一步发现,明确禁止某种构造反而会使其集中出现而非消失——96%的遗留缺陷集中在提示词明确指出的那两种形式上——并且,将随机标注与确定性窗口函数结合使用,会使从字节完全相同的文件中提取出的需求条目数从68降至51。结构应出现在模型阅读之处;散文和自我应用的测试则应出现在模型撰写之处。
查看缓存全文
缓存时间: 2026/08/24 04:24
# 阅读用结构,写作用散文:多智能体文档协作中的非对称结构化条件控制 来源:https://arxiv.org/html/2608.20786 ## 阅读用结构,写作用散文:多智能体文档协作中的非对称结构化条件控制 致谢:本工作由 ML Research Labs(Trellis Data 旗下公司)资助。 Nikhil Mathew 所属机构:ML Research Labs,澳大利亚堪培拉 通讯邮箱:[[email protected]](mailto:[email protected]) Zhengjie Wang 所属机构:ML Research Labs,澳大利亚堪培拉 通讯邮箱:[[email protected]](mailto:[email protected]) ###### 摘要 用于撰写正式文档的多智能体流程必须既能阅读请求方的表单,又能据此进行撰写。我们报告了一个已部署的投标响应系统,该系统在数据主权约束下运行开源模型,并通过该组织实际提交的人类投标书进行评估。在一次无可用参考案例的盲测比较中,LLM 评审员在 55 个真实章节中有 40 个将系统答案评分不低于人类提交的答案,其中 4 个评分更高,无缺失,并仅标记出一个无依据的断言。对评审员识别的每处差异进行分类表明,68% 的差异内容在系统自身资料中即缺失——这些是人类作者掌握而流程从未获取的信息——因此在 15 个负面判定中,仅有 6 个涉及系统本可避免的缺陷。与真实答案的偏离更多源于信息可用性,而非写作质量问题,不区分这两者的评估系统会低估此类系统的能力。 基于此背景,我们报告一种条件控制的不对称性。将文档呈现为结构化标记而非纯文本可改善信息提取,这一点已得到广泛证实,我们在三项阅读任务中复现了此结论。然而该优势并未转移到条件控制上:将投标的*指令*材料从散文转换为嵌套 XML 后,在配对比较中答案质量从 74% 下降至 48%。我们进一步发现,明确禁止某种构造反而会使其集中出现——96% 的残留缺陷均出现在提示词明确指出的两种形式中;此外,将随机标注与确定性窗口函数耦合后,即使处理字节完全相同的文件,提取的需求数量也会从 68 变为 51。结构化适用于模型阅读的部分;散文和自检测试则适用于模型撰写的部分。 参考图表图 1:与人类工作的对比评估。(a) 系统答案与该组织为同一采购项目提交的人类投标书的对比,由 LLM 评审员基于优劣而非相似性评分;本次投标中系统无参考案例可用。下方柱状图在排除仅因系统源中缺失信息导致的负面判定后重新评分(§3.2)。(b) 评审员识别的每处差异,按原因分类。(c) 在另一采购项目中,人类编辑基于系统草稿进行修改;直方图显示每个草稿答案中保留至提交文档的措辞比例(§3.3)。 ## 1 引言 正式文档协作——投标响应、监管备案、合规矩阵——与常规生成式场景相反。输出必须返回至请求方自身文件的固定布局中;分散文档集中的每项义务必须得到回应;且请求方的措辞需原样保留,因为经过改写的需求可能导致评审员无法识别。在数据主权约束下,执行此任务的模型不能使用前沿 API,这消除了其他系统用于处理文档复杂性的余量。 该领域的前期工作已证实,单一模型无法可靠完成此任务:从异构材料中稳定提取信息、保持一致的多步骤分析以及系统验证输出,需要将阅读、提取和起草角色分离。多智能体分解是标准应对方案。Co-Scientist 证明,在专门化智能体中将生成与评审隔离可显著提升可靠性,有向无环图已成为此类系统的编排基础,取代了易偏离的开放式对话循环。 另一系列文献证实,语言模型处理结构化文本优于散文:将生成限制在可验证的提取-验证-列举流程中可使 F1 提升 31%;仅序列化格式就能在问卷理解任务中带来高达 8.8 个百分点的准确率提升;而提供分层控制流结构代替扁平化反编译器输出,可将编译成功率从 45.0% 提高到 85.2%。 第三类文献研究错误如何在顺序智能体链中传播,且结论存在分歧:在四个智能体中检测注入错误的准确率从 72.0% 下降至 50.9%;而一项涵盖 500 个级联系统的研究表明,更深的链在牺牲事实准确性的同时*降低*了整体幻觉率。这些发现均支持在每个交接环节进行验证,并积极压缩上下文。 所有这些结构性结论都是基于*阅读*任务测量的——如查找数值、匹配指令、列举字段。我们尚未发现有研究测试当结构化材料不是待读文档,而是模型必须内化并据此撰写的指令时,同样的优势是否依然成立。本文报告该优势不复存在。 我们的贡献包括: - • 针对人类投标书的系统评估,包括一次无参考案例的盲测比较(§3.2),以及一次人工基于机器草稿进行编辑的后处理测量(§3.3)。 - • 一种正确解读此类比较的方法:将每处差异按内容是否存在于系统中分类,可将信息可用性问题与写作问题分离,使评分从 73% 提升至 89%(§3.2)。 - • 一项对照配对比较,表明结构化标记在所有测试的阅读任务中有助益(§3.4),但应用于指令材料时效果*相反*(§3.5)。 - • 一项基于表面形式解析的禁止性命名测量:残留缺陷恰好集中在提示词明确命名的构造形式中(§3.6)。 - • 一种在错误级联文献中缺失的方差传播机制:确定性窗口函数接受随机标注后,会放大上游方差(§3.7)。 ## 2 系统 该系统是一个包含 43 个单轮智能体角色和一个多轮起草者的有向图,每个角色拥有独立的系统提示词,且仅接收其任务所需的上下文。系统在三个人工编辑关口上分六个阶段运行,因此高成本的语义处理仅执行一次,以可检查的 JSON 格式持久化,并在下一阶段使用前可被人工修正(图 2)。 A 文档→标记元素流 B 标记→答案槽位(回声差异) C 带标记的标记→问题——编辑关口—— D 问题+证据→提示词——编辑关口—— E 提示词→答案(并发会话) F 答案→请求方自有文件 V 所有内容→LLM 验证面板 图 2:六阶段流程图。阶段 V 在每次执行中非致命性运行。 #### 标记与定位器 每个输入文档被解析为有序元素流——每个段落、表格单元格、电子表格单元格或幻灯片形状作为一个元素——携带合成标识符 eid、源文件中的可逆定位 loc、渲染文本和格式标记。流被渲染为保留文档树的嵌套标记,因为扁平的“每元素一行”渲染会破坏将问题与其指令和答案框配对的包含与邻接关系: ``` 2.1 描述... 最多 2 页。 ``` 整个系统遵循两条规则:定位器用于寻址而非分类——模型从可见结构判断元素*是什么*,坐标仅在后续写回答案时使用;需求文本由代码从元素流中剪接,永不被模型重打字。因此,幻象坐标无法到达文件写入器,改写后的需求也无法到达评审员。 #### 基于回声差异的答案槽位 我们不在模式中描述槽位,而是向模型提供一个标记窗口,要求其保持窗口内容不变地回传,但每个需受访者填写的单元格替换为哨兵标记;代码通过差异比较回声内容。模型执行一次转换而非十二字段分类,且从未接收的 eid 不可能出现在输出中。窗口大小根据复制保真度调整——其衰减通常出现在窗口中部而非边缘。在同一文档上,23.5k 字符窗口在相对位置 0.61–0.63 处无声丢失标记,发现 30/32 个槽位;而 8k 窗口回传全部 407 个元素并发现 32/32 个槽位,速度快 5.7 倍——因为短调用可并行化,长调用则在生成时串行化。由于丢失发生在窗口中部且无声,我们计算的是进入窗口但未返回的元素数量,而非假设无丢失。 枚举任务则需相反设置:问题提取运行于更大窗口,因为广度能让模型发现分散在多个问题中的义务应归属此处。因此块大小是任务级参数,而非系统常量。 #### 起草会话 一个章节对应一个聊天会话,也是并行的基本单元;章节内的问题串行处理,因为累积的历史可确保相关答案间的术语和数据一致。会话按首次完成连续调度,而非同步层级,因为链长度差异显著。每个问题分四轮撰写:自问计划;基于过往投标中最匹配答案的草稿;针对投标原文要求的合规性检查;以及可增加、重构或标记但永不删除的质量检查。 示例检索基于输入需求与过往请求方提出*问题*的匹配(而非匹配我们自身的散文),这是离线“问题到问题”对称性的实现,仅移除了假设步骤——在我们提交的投标语料库中,复用的是历史问题而非合成问题。投标永远不会看到其自身的过往响应:系统强制排除自身,且同产品关卡为硬性限制,因此在小型库中常见结果是无示例可用。该路径必须保持静默无害,§3.2 将对此进行测试。 ## 3 实验 ### 3.1 设置 我们在四个澳大利亚和新西兰公共部门采购项目(记为 T1–T4)上进行评估。请求方身份、行业及文档内容已隐去:这些属于竞争性商业投标。每个项目存在两种形式——该组织实际撰写提交的响应,以及本系统为同一空白表格生成的响应——这使得 §3.2 和 §3.3 的比较成为可能。 生成运行于参数量低于 200B 的开源模型,部署在澳大利亚基础设施上,不使用思考标记且无服务端会话状态,通过两个独立 AIMD 限速器的端点运行。这不是前沿模型,这对 §3.6 很重要。温度始终保持模型默认值:可复现性声称必须在实际部署的配置下成立,而非温度为零时。所有质量判定均来自 LLM 验证智能体,不使用词汇规则评分。答案质量的记录判定为每个答案的三重判断——*回答问题*、*部分复述*或*主要复述*。我们引用的词汇计数均为在流程外计算作为佐证,§3.9 将解释为何该佐证不可靠。 ### 3.2 对比人类基准 对于 T3,该组织在系统存在前已提交人类撰写的响应。因此该响应可用作盲测基准,且由于自我排除机制适用,系统无法以此为条件:T3 的 120 个提示词均未携带示例块。系统在完全无参考案例的情况下完成了 T3 撰写。 我们将人类提交内容恢复为 55 个(问题, 答案)章节,要求验证器将每个章节与系统中覆盖相同范围的章节组合进行比较。评审员被指示基于*优劣而非相似性*评分——包括响应度、实质内容、规范性和深度——并明确告知基准答案是良好答案而非唯一答案。输出*更好*、*相当*、*较弱*或*缺失*,并标记任何看似虚构的系统断言。结果见图 1(a) 和表 1。 系统在 55 个章节中的 40 个(73%)被评为不低于人类答案,4 个评分更高,且无*缺失*——每个基准章节均有对应内容覆盖。在全部 55 个章节中,评审员仅标记出一个无依据的断言:从仅描述单点登录的段落推断出多因素认证的存在。 表 1:T3:系统答案对比人类投标书,n=55 个基准章节。 #### 偏离并非自动等同于缺陷 15 个负面判定包含 70 处具体差异,若将其直接视为质量失败则属范畴错误。生成的答案仅能包含系统资料支持的内容。当人类作者从经验、同事或未进入流程的对话中获知信息时,由此产生的偏离衡量的是信息可用性而非写作质量。因此我们对每处差异进行分类:针对每处差异,我们收集系统在此次投标中的完整语料——八份参考文献(按配置上限截断)加投标自身文档及四份附录,共 372,139 字符——记录差异中命名实体是否在语料中出现,并由分类器归因于以下四种原因:内容在我们的资料中*不可用*;*可用但未使用*;属于*策略偏离*(该组织已停止主张的内容);或属于问题未要求的*额外细节*。 表 2:评审员在 T3 识别的每处差异原因(n=70,剔除两条空记录后)。 表 2 显示 68% 的差异属于流程从未获取的内容:一个命名的集成平台、一个精选的角色库……
相似文章
使用多智能体评估对角色扮演语言智能体进行对抗性压力测试
本文提出了一个模块化的多智能体平台,用于对角色扮演语言智能体进行对抗性压力测试,通过策略驱动的审讯智能体和自动化评判智能体,揭示多轮对话中累积的行为失败。跨三个人设和三类LLM家族的实验表明,多策略对抗评估将鲁棒性得分降低0.17-0.20,并识别出常见的失败模式,且与人类评判高度一致。
为什么用文本给AI编码代理提供架构上下文从根本上说是有问题的
AI编码代理在处理文本描述时难以应对隐式的架构决策。作者构建了specrabbit,一个可视化画布,通过类型化节点和流程定义架构,并导出机器可读的规范。
ASMR:面向船舶维修报告编写的智能模式生成
本文提出了ASMR,一种智能框架,包含字段生成智能体和结构优化智能体,利用强化学习从历史船舶维修报告中自动生成紧凑且信息丰富的模式,旨在提高报告的完整性和一致性。
内部文档:为人类、智能体还是两者编写?
本文讨论了内部文档是否应以人类可读性编写,还是优化以提高AI智能体效率,探讨了权衡并提倡根据具体情境制定格式。
我创建了一个代理来审阅我的写作。它的配置文件是一份心理档案,而非手册。
作者通过综合用户访谈和行为数据,创建了一个心理档案来配置AI写作审阅代理,使其从愤世嫉俗、技术性的受众角度批评草稿。