HULAT2 在 MER-TRANS 2026 中的参与:面向西班牙语易读文本生成的受控多智能体简化
摘要
本文描述了 HULAT2-UC3M 在 MER-TRANS 2026 共享任务(西班牙语易读文本生成)中的参与情况,采用基于 LangGraph 和 Gemini/RigoChat 模型的受控多智能体工作流,取得了最佳 SARI 得分 44.05。
查看缓存全文
缓存时间: 2026/07/03 05:43
# HULAT2 在 MER-TRANS 2026:面向西班牙语易读生成的受控多智能体简化系统 来源:https://arxiv.org/html/2607.02381 \copyrightclause 本文版权归作者所有。根据知识共享署名 4.0 国际许可证 (CC BY 4.0) 允许使用。 \conferenceIberLEF 2026,2026 年 9 月,西班牙莱昂 \[ orcid=0000-0002-9021-2546, [email protected], url=https://hulat.inf.uc3m.es/ \] \[ orcid=0000-0003-3013-3771, [email protected], url=https://hulat.inf.uc3m.es/ \] \[ orcid=0009-0001-8163-5440, [email protected] \] \[ orcid=0009-0001-8163-5440, [email protected] \] (2026) ###### 摘要 本文描述了 HULAT2-UC3M 在 MER-TRANS 2026 西班牙语赛道中的参与情况。MER-TRANS 2026 是一项多语言易读翻译的共享任务。我们提交了三个全自动西班牙语运行方案。RUN1 和 RUN2 使用基于 LangGraph 的多智能体工作流,结合了 Gemini 2.5 Flash 和 RigoChat-7B-v2、并行生成策略、内部质量信号、事件-条件-动作路由、受控编辑和可追溯决策。RUN1 使用基础工作流,而 RUN2 激活了一个基于词汇表和词汇资源的额外词汇支持层。RUN3 是一个基于 RigoChat 的生成-评估-再生成基线,采用了提示工程和 LoRA 适配。 官方排行榜报告了 BLEU-Orig、BLEU-Gold、SARI 和 BERTScore。在开发过程中,还检查了额外的内部信号,包括语义保真度、可读性、词汇简洁性、句法清晰度和事实一致性。根据官方 SARI 指标,RUN1 是 HULAT2 的最佳运行方案,得分为 44.0543,其次是 RUN2 (43.1049) 和 RUN3 (38.5136)。这些结果表明,在此任务设置中,信号引导的多智能体路由优于线性再生成基线。它们还表明,添加词汇支持并不能自动提高基于参考的分数。需要进一步的段落级和文档级分析来评估可读性、事实一致性和面向用户的充分性。 ###### 关键词: 易读\sep 文本简化\sep 多智能体系统\sep 西班牙语\sep 无障碍\sep 以人为中心的自然语言处理 ## 1. 引言 获取可理解的信息对于参与、自主和获取公共服务至关重要。这对于有认知无障碍需求、阅读理解困难、低识字率的人群、老年人、非母语使用者以及面临不熟悉或专业内容的用户尤其重要。认知无障碍旨在减少理解、沟通和互动方面的障碍,并已在 ISO 21801-1:2020 [iso21801] 等标准中形式化。在基于文本的沟通中,这些障碍通过简明语言 (PL)、易读 (E2R) 和自动文本简化等方法来解决。 PL 和 E2R 相关但不等同。PL 侧重于使信息对其目标受众清晰、可查找、可理解和可用,如 ISO 24495-1:2023 [iso24495] 所定义。E2R 通常对词汇、句法、布局和验证施加更严格的约束,特别针对有阅读理解困难的人群。在西班牙,E2R 实践得到了 UNE 153101:2018 EX 的支持,该标准为易读文档的制作和验证提供了建议 [une153101]。国际指南,如 IFLA 指南和 Inclusion Europe 建议,也强调了清晰语言、简单结构和面向读者验证的必要性 [ifla2010easyread, inclusioneurope2009easyread]。因此,面向无障碍的简化不应仅局限于词汇替换或句子缩短;它还涉及内容选择、观点之间的明确关系、文档结构、术语控制以及相关信息的保留。 自动文本简化已从基于规则和统计的方法发展到神经模型,以及最近的大语言模型 (LLM) [saggion2017automatic, nisioi2017neural]。LLM 可以执行词汇替换、句子拆分、改写、删除次要信息和解释性重写。然而,基于 LLM 的简化也引入了风险:输出可能流畅通顺且看似简单,同时却省略了相关信息、添加了未经证实的解释、改变了数字信息或改变了源文本的含义。这在面向无障碍的设置中尤其重要,因为输出不仅需要更简单,还必须可靠、可用且适合目标读者。在西班牙语中,先前的工作利用并行的 E2R 资源、微调和专家定性评估,探索了基于解码器的 LLM 用于易读生成 [martinez2024exploring]。这些结果显示了基于 LLM 的简化的潜力,同时强化了对术语支持和人工验证的需求。 评估仍然是一个核心挑战。像 BLEU、SARI 和 BERTScore 这样的指标对于基准测试很有用,但它们仅捕捉了部分质量方面 [papineni2002bleu, xu2016sari, zhang2019bertscore]。BLEU 奖励与参考的表面重叠,SARI 评估添加、保留和删除操作,BERTScore 通过上下文嵌入估计语义相似度。先前的工作表明,自动指标可能会惩罚有效的改写,并且不能完全捕捉改编后的文本是否更清晰、组织得更好或对其目标受众更有用 [alvamanchego2021unsuitability, maddela2023lens]。其他工作也指出,句子级评估对于文档级简化来说可能过于狭窄,并且简洁性和意义保留应作为不同的维度进行评估 [maddela2025document, cripwell2024readi]。以人为本的评估研究进一步表明,专家判断、自动分数和实际读者理解可能存在分歧 [agrawal2023human, carrer2024multifaceted]。 最近的研讨会和共享任务为简化、可读性和无障碍建立了更系统的评估设置。TSAR 系列巩固了文本简化、可读性和无障碍的研究 [saggion2022tsar, tsar2023, tsar2024, tsar2025]。TSAR 2025 包括一个关于可读性受控文本简化的共享任务,系统必须根据指定的基于 CEFR 的熟练程度调整文本,同时保持含义和流畅性 [alvamanchego2025tsar]。READI 2024 针对有阅读困难人群的工具和资源,并包括了文档级简化和超越孤立句子的评估工作 [readi2024, cripwell2024readi]。在西班牙语背景下,CLEARS 2025 在 IberLEF 中处理了 PL 和 E2R 适配,使用语义相似度和 Fernández-Huerta 可读性指数作为官方指标 [botellagil2025clears]。这些举措显示了从通用简化向受控、多语言、特定语言和面向无障碍的评估设置转变。它们也突出了在语义保留、可读性、面向用户的充分性和参考对齐之间取得平衡的困难。 MER-TRANS 2026 将这条工作线扩展到多语言易读翻译。任务要求参与系统生成复杂文本的 E2R 导向版本,官方结果使用 BLEU-Orig、BLEU-Gold、SARI 和 BERTScore 报告 [saggion2026mertrans]。本文的贡献在于描述 HULAT2-UC3M 向 MER-TRANS 2026 提交的西班牙语方案,使用信号引导的多智能体架构进行受控的 E2R 导向生成,并分析官方结果。 ## 2. 任务与数据 MER-TRANS 2026 是 IberLEF 2026 的一部分 [saggion2026mertrans, iberlef2026overview]。该共享任务使用覆盖多语言易读适配和句子难度评估的数据资源。iDEM 语料库提供了人工标注的原文和易读文本,旨在支持对民主参与过程的访问 [bott2026idem]。共享任务文档还包括由 Khallaf 和 Sharoff 引入的阿拉伯语句子难度分类数据集 [khallaf-sharoff-2021-automatic]。 MER-TRANS 2026 评估用于从原始复杂文本生成易读 (E2R) 改编版本的自动系统。HULAT2-UC3M 仅提交了西班牙语运行方案,并且在官方推理过程中未使用人工干预。 MER-TRANS 评估材料描述了共享任务的几个指标家族,包括表面相似度指标、面向简化的指标、语义相似度指标、可读性指标和复杂度分类器 [mertrans2026website]。然而,用于共享任务的官方评估器仓库计算 BLEU、SARI 和 BERTScore,并且已发布的排行榜报告了针对原始文本的 BLEU (BLEU-Orig)、针对黄金 E2R 参考的 BLEU (BLEU-Gold)、SARI 和 BERTScore [mertrans2026evaluator, mertrans2026website]。因此,本文使用这些排行榜指标报告官方结果。 SARI 对于简化尤其重要,因为它评估相对于源文本和参考的添加、保留和删除操作 [xu2016sari]。BLEU 提供表面重叠信号,而 BERTScore 基于上下文嵌入提供互补的语义相似度信号 [zhang2019bertscore]。这些指标为任务提供了共享基准,但它们并未完全捕捉面向无障碍的质量维度,例如事实一致性、术语支持、可读性、文档连贯性或面向用户的充分性。 在开发时评估中,HULAT2 系统的配置并非专门用于最大化官方分数。SARI、BLEU 和 BERTScore 被用作外部基准指标,而候选生成、路由和重试决策则由更广泛的内部质量信号指导,包括简化、语义相似度、事实一致性和可读性指标 [hulat2026bilingualmetrics]。在 MER-TRANS 实验中,这些开发时信号用于支持提示校准、事件-条件-动作 (ECA) 路由、重试条件和定性错误分析。 ## 3. 系统描述 本节描述了用于 HULAT2-UC3M 向 MER-TRANS 2026 提交西班牙语方案的资源、实验证据基础和系统配置。本节首先介绍开发过程中使用的资源,然后总结提交的运行方案,最后描述多智能体工作流和基线系统。 ### 3.1 资源与证据基础 为了进行系统校准、提示优化和词汇表构建,我们使用了与制度、公民和公共信息背景相关的公开西班牙语 E2R 材料。这些资源支持了对句子分割模式、解释性表述、词汇选择和常见 E2R 惯例的分析。它们包括《西班牙宪法易读版》、公民参与指南、选举参与材料,以及由 Plena Inclusión 和公共行政部门发布的公务员考试准备材料。用于校准和词汇支持的公共资源详细列表见附录 A (https://arxiv.org/html/2607.02381#A1)。 这些材料的一部分被用来构建一个内部的 HULAT-UC3M 学习词汇表和简短解释形式词汇表。该词汇表在 RUN2 中用作词汇支持。RUN2 还整合了西班牙语医学词汇简化资源 [campillos2022clara]。虽然 MER-TRANS 的主要领域不是医学,但这些资源作为困难术语的额外词汇简化材料和解释性改写材料很有用。这些资源不属于官方 MER-TRANS 测试集。 除了这些文本资源,系统设计还基于先前为无障碍文本生成而整理的实验证据基础。该证据基础包括用户研究、标注资源和面向无障碍评估的结果,并被操作化为质量信号、检查清单、ECA 规则和可读简化评审标准 [moreno2026hitlhotl]。在 MER-TRANS 运行中,该证据在官方推理期间未用作人工干预,而是作为开发时支持,用于提示调整、路由规则、重试条件和定性分析。 ### 3.2 提交的运行方案 我们提交了三个西班牙语运行方案。RUN1 使用基于 LangGraph 的基础多智能体工作流,包括并行生成、候选评估、ECA 风格路由和受控编辑。RUN2 使用相同的工作流,但在生成前激活了词汇智能体,以测试词汇表和词汇资源支持是否能改进基础配置。RUN3 是一个独立的基于 RigoChat 的生成-评估-再生成基线,旨在比较多智能体路由策略与更线性的简化流程。 表 1 (https://arxiv.org/html/2607.02381#S3.T1) 总结了在流程级别提交的配置。该表区分了 RUN1 和 RUN2 使用的多智能体工作流和 RUN3 使用的线性基线工作流,并指明了哪些阶段是共享的、可选的或每个运行方案独有的。 表 1:HULAT2-UC3M 提交配置的流程级描述。 | 流程阶段 | 阶段或模块 | 主要资源或模型 | 功能 | 运行方案 | | :--- | :--- | :--- | :--- | :--- | | RUN1 和 RUN2 使用的多智能体工作流 | | | | | | 可选的词汇支持 | 词汇智能体 | 词汇表和词汇资源 | 检测困难术语并在生成前提出词汇支持。当词汇智能体被禁用时,此阶段被跳过。 | RUN2 | | 预分析 | 预分析模块 | 基于规则的特征提取 | 检测结构、词汇和事实风险特征,包括句子长度、标点复杂度、数字、日期、否定、条件和词汇表术语。 | RUN1、RUN2 | | 并行生成 | 生成器 A | Gemini 2.5 Flash | 生成一个保守的、面向简明语言的候选方案,优先考虑意义保留和最小改写。 | RUN1、RUN2 | | 并行生成 | 生成器 B | RigoChat-7B-v2 | 生成一个结构简化的候选方案,优先考虑句子拆分、直接性和降低词汇难度。 | RUN1、RUN2 | | 并行生成 | 生成器 C | Gemini 2.5 Flash | 生成一个面向易读的候选方案,以短句、常用词汇、显式结构和操作性的 CEFR A2 目标为导向。 | RUN1、RUN2 | | 候选评估 | 候选评估器 | 内部质量信号 | 使用语义、事实、句法、词汇、可读性和鲁棒性信号评估候选方案。 | RUN1、RUN2 | | 路由与控制 | ECA 路由器 | 事件-条件-动作规则 | 根据检测到的质量概况和风险信号选择、编辑、合并或重试候选方案。 | RUN1、RUN2 | | 受控编辑 | 合并-编辑器 | 受限编辑提示 | 仅当检测到互补改进且无语义风险信号时,应用最小限度的受控编辑或融合候选方案。 | RUN1、RUN2 | | 最终验证 | 最终评估器 | 内部验证信号 | 在生成最终输出之前重新检查事实一致性、语义保留和鲁棒性。 | RUN1、RUN2 | | RUN3 使用的线性基线工作流 | | | | | | 生成 | 基线生成器 | RigoChat-7B-v2,带提示工程和 LoRA 适配 | 使用受控基线配置生成面向易读的输出。 | RUN3 | | 质量控制 | 基线评估器 | 内部可读性和语义保留检查 | 使用内部质量标准评估生成的输出,包括可读性...
相似文章
DS@GT ARC 在 eRisk 2026 中的应用:具有结构化算法指导的混合多智能体大语言模型系统用于对话式抑郁症筛查
本文描述了提交给 eRisk 2026 挑战赛的用于对话式抑郁症筛查的混合多智能体大语言模型系统,该系统使用付费的 GPT-5-nano 或开源 Gemma 27B 模型,并辅以算法指导(对话树、可靠性加权聚合、基于聚类的插补),以较低成本实现具有竞争力的 BDI-II 评估。
HawkesLLM:智能体文本模拟中的语义不确定性传播
本文介绍了HawkesLLM,一个通过结合用于时间影响和记忆选择的多变量Hawkes过程与用于文本生成的语言模型,对多步骤智能体文本模拟中的语义不确定性传播进行建模的框架。在GDELT新闻级联案例研究上的评估表明,在紧凑的提示-记忆约束下,后期语义对齐得到了改善。
面向文化图像描述的长上下文检索增强翻译:Gators在AmericasNLP 2026共享任务中的提交
佛罗里达大学Gators团队提交至AmericasNLP 2026共享任务,该任务涉及面向土著语言的文化图像描述。我们采用双阶段流水线:使用Qwen2.5-VL生成西班牙语中间描述,然后通过检索增强的多示例提示,利用Gemini 2.5 Flash生成目标语言描述。与基线相比,取得了显著提升。
@yoheinakajima: 更多人现在正在尝试这种通过共享状态进行通信的智能体方法(而非彼此对话)
Azalia Mirhoseini 强调 DeLM,一种去中心化语言模型方法,其中智能体通过共享状态通信,在SWE-bench Verified上使用Gemini-3 Flash实现了约10%的提升,且成本不到一半。
在现实对话环境中评估语言模型
本文介绍了UPHELD,这是一个用于评估LLMs人类规模对话能力的大型基准,并提出了一个Mixture-of-Judges框架,将与人类评估的相关性提高了约30%。