Yuvion LLM:一种具有对抗意识的大型语言模型,用于内容和AI安全
摘要
Yuvion LLM 是一种专为对抗鲁棒性和内容安全而设计的大型语言模型,在安全基准测试中达到了最先进的性能,并超越了 GPT-5.4 和 Qwen3-MAX 等更大的模型。
arXiv:2606.27632v1 公告类型:新
摘要:随着大型语言模型越来越多地部署在现实系统中,安全故障仍然可能导致有害输出和危险滥用。我们认为安全的本质是对抗性的:许多故障不仅源于自然输入,还源于规避模型政策和安全防护的战略性尝试。然而,现有通用模型开发在很大程度上忽视了这种对抗性,并且对于涉及规划、工具使用和多步推理的现实安全场景往往不足,导致测量到的安全性能高估了实际部署的鲁棒性。为解决这一差距,我们推出了 Yuvion LLM,这是一种为对抗鲁棒的內容安全和更广泛的 AI 安全而构建的大型语言模型。Yuvion LLM 将对抗鲁棒性和智能体能力作为首要目标。其流程结合了对抗意识的数据构建、知识增强的持续预训练、基于策略的多任务安全后训练(包括风险感知的监督微调和基于强化学习的策略优化),以及用于复杂安全场景中工具使用和多步推理的安全感知智能体强化学习。我们还引入了 Yuvion LLM RiskEval (YLRE),这是一个包含 93 个基准测试的集合,涵盖四个评估类别,涉及多样化的开放和内部评估,重点关注安全性、对抗鲁棒性和实际能力要求。在这些评估中,Yuvion LLM 在安全导向的基准测试上展现出明显优势,尤其在对抗条件下表现出特别强的鲁棒性,同时保持整体能力稳固。值得注意的是,Yuvion-8B 在多项安全任务上超越了大多数最先进的基线模型,包括 GPT-5.4 和 Qwen3-MAX 等规模更大的模型。
查看缓存全文
缓存时间: 2026/06/29 05:23
# Yuvion LLM:一个面向内容和人工智能安全的对抗性感知大型语言模型 来源:https://arxiv.org/html/2606.27632 ###### 摘要 随着大型语言模型越来越多地部署在现实世界系统中,安全故障仍可能导致有害输出和危险误用。我们认为,安全的本质是对抗性的:许多故障不仅源于自然输入,更源于策略性地试图规避模型策略和安全防护的行为。然而,现有通用模型开发很大程度上忽视了这种对抗性本质,在面对涉及规划、工具使用和多步推理的现实安全场景时往往显得不足,导致测量的安全性能高估了实际部署的鲁棒性。为弥补这一差距,我们提出了Yuvion LLM,一个为对抗性鲁棒的内容安全和更广泛的人工智能安全而构建的大型语言模型。Yuvion LLM将对抗性鲁棒性和智能体能力视为首要目标。其流程结合了对抗性感知的数据构建、知识增强的持续预训练以及策略驱动的多任务安全后训练,包括风险感知的监督微调和基于强化学习的策略优化,同时结合了安全感知的智能体强化学习,以支持在复杂安全场景中的工具使用和多步推理。我们还引入了Yuvion LLM RiskEval (YLRE),这是一个包含93个基准测试的集合,涵盖四个评估类别,包括多样化的开源和内部评估,重点关注安全、对抗性鲁棒性和现实世界能力需求。在这些评估中,Yuvion LLM在安全重点基准测试上展现出明显优势,尤其在对抗性条件下表现出强大的鲁棒性,同时保持了扎实的整体能力。值得注意的是,Yuvion-8B在多项安全任务上优于大多数最先进的基线模型,包括显著更大的模型如GPT-5.4和Qwen3-MAX。††脚注:计划部分开源发布。如需试用,请联系[email protected]。参考图注Figure 1:跨基准设置的评估概览:开源安全(公共内容安全基准上的宏F1)、对抗性安全静态和动态(自构建红队对抗基准上的F1和100−100−组合得分)以及工业部署(内部能力和业务综合得分)。Yuvion-32B在所有面板上取得最佳结果,得分分别为78.2、94.2、79.4和86.1,优于包括GPT-5.4和Qwen3-MAX在内的所有基线。Yuvion-8B也超越了大多数基线,并与显著更大的模型保持竞争力。 ## 1 引言 大型语言模型(LLMs)越来越多地部署在现实世界系统中,用于内容审核、用户交互、决策支持、工具使用和多步任务执行(Brown等人,2020 (https://arxiv.org/html/2606.27632#bib.bib1);Achiam等人,2023 (https://arxiv.org/html/2606.27632#bib.bib2);Schick等人,2023 (https://arxiv.org/html/2606.27632#bib.bib4);Yao等人,2023 (https://arxiv.org/html/2606.27632#bib.bib5);Wang等人,2024a (https://arxiv.org/html/2606.27632#bib.bib6);Qwen Team,2025 (https://arxiv.org/html/2606.27632#bib.bib3))。随着这些系统融入社会和经济活动,安全故障可能导致有害内容、违禁交易,以及通过越狱或策略规避获取危险信息。最近基于LLM的安全系统(Inan等人,2023 (https://arxiv.org/html/2606.27632#bib.bib23);Meta,2025 (https://arxiv.org/html/2606.27632#bib.bib24);Qwen Team,2025 (https://arxiv.org/html/2606.27632#bib.bib3))已帮助缓解了许多此类风险。然而,我们识别出这些系统共有的一个根本性局限:在人类对抗性行为下的脆弱性。图2 (https://arxiv.org/html/2606.27632#S1.F2)具体说明了这一局限。底层的恶意意图保持不变,但一个能正确拒绝原始输入的通用LLM,一旦请求通过委婉表达、符号替换或跨语言混合重新表述,就会失败。这指出了核心挑战:部署中的不安全行为不仅源于自然输入,更源于策略性的、适应性的规避模型防护的尝试。在内容安全中,恶意意图可以通过词汇混淆、编码语言、情境伪装或平台外流量混淆来隐藏;在更广泛的人工智能安全中,模型可能通过越狱、提示注入、角色扮演和多轮攻击被操纵(Perez等人,2022 (https://arxiv.org/html/2606.27632#bib.bib11);Wei等人,2023 (https://arxiv.org/html/2606.27632#bib.bib12);Mazeika等人,2024 (https://arxiv.org/html/2606.27632#bib.bib17))。现有通用模型在开发和评估时大多未考虑这种策略性人类行为,导致测量的安全性能系统性地高估了实际部署的鲁棒性。这种对抗性挑战在智能体环境中愈加强烈。实际生产安全场景通常涉及级联策略规则、跨模态证据收集和专用工具调用。例如,确定一个产品列表是否侵犯注册商标,可能需要遵循多步决策程序、调用图像检测工具、并在做出判断前综合跨模态证据。这些操作需求要求真正的智能体能力:规划多步推理链、调用外部工具、检索策略文档并据此进行决策、以及根据中间结果调整执行路径。然而,现有的面向安全的模型,包括专用防护模型(Inan等人,2023 (https://arxiv.org/html/2606.27632#bib.bib23);Meta,2025 (https://arxiv.org/html/2606.27632#bib.bib24);Qwen Team,2025 (https://arxiv.org/html/2606.27632#bib.bib3)),仍局限于单轮安全判断,缺乏对工具使用、策略检索或多步执行的支持。随着内容安全系统从文本分类扩展到多模态、多工具审计管道,智能体能力成为实际部署的结构性要求。这两个差距——在对抗性规避下的脆弱性以及智能体能力的缺失——激发了我们工作的核心前提:对抗性鲁棒性和智能体安全能力必须被设计性地构建到模型开发和评估中,而不仅仅是作为事后防护措施添加。鲁棒的安全性要求模型能够识别被模糊化的风险,在对抗压力下保持对齐,并在涉及规划、策略依据、工具使用和自适应多步推理的现实安全场景中可靠运行。参考图注Figure 2:对抗性安全规避的说明性示例。左图:一个暴力或恐怖相关请求通过委婉表达和跨语言混合(拼音替换)逐步模糊化。右图:一个极端主义相关请求从直接攻击规划查询升级为委婉陈述和基于权威的语境重构。 为此,我们提出了Yuvion LLM,一个为对抗性鲁棒的内容安全和更广泛的人工智能安全构建的大型语言模型。Yuvion LLM围绕两个首要目标设计:对抗性条件下的鲁棒安全以及面向现实部署场景的智能体安全能力。为实现这些目标,Yuvion采用了一种渐进式安全训练范式,包含三个阶段:知识增强的持续预训练,注入安全领域知识;策略驱动的多任务安全后训练,引发出风险理解、细粒度风险识别以及在对抗变化下符合策略的决策能力;以及安全感知的智能体强化学习,将模型扩展到安全场景中的检索、工具使用和多步推理。这些阶段共同强化了模型的安全相关知识、对抗性鲁棒性、策略驱动的决策能力以及现实安全场景中轨迹级别的可靠性。通过这种方式,Yuvion LLM的意图不仅是作为一个防护分类器,而是作为一个更通用的面向安全的模型用于实际部署。我们还引入了Yuvion LLM RiskEval (YLRE),一个四级渐进式评估框架,涵盖93个基准测试,包括开源通用基准测试、开源安全基准测试、自构建的对抗性安全基准测试以及内部能力和业务基准测试。该框架旨在联合评估通用能力保持、公开安全性能、对抗性鲁棒性和现实世界运营价值。更具体地说,前两级衡量安全专业化是否保留了通用能力并在已建立的公开基准测试上保持竞争力;第三级在控制但真实的变化模式下测试对抗性鲁棒性;第四级评估涉及智能体能力和业务需求的实践环境中的性能。这种渐进式设计使我们能够不仅检验模型原则上是否理解风险和安全性,而且检验其在大规模、复杂、多轮和对抗密集型生产环境中是否保持可靠和精确。本研究的主要贡献如下: - • 我们认为安全应被视为一个固有的对抗性问题,并且对抗性鲁棒性和智能体能力都必须设计性地构建到模型开发中。基于这一原则,我们提出了Yuvion LLM,一个为对抗性鲁棒的内容安全和更广泛的人工智能安全构建的大型语言模型,其开发流程整合了对抗性感知的数据构建、知识增强的持续预训练、面向安全任务的后训练,以及使模型具备工具调用、多步推理和复杂安全场景任务执行能力的智能体强化学习。 - • 我们引入了Yuvion LLM RiskEval (YLRE),一个四级评估框架,涵盖93个基准测试,包括开源通用基准测试、开源安全基准测试、自构建的对抗性安全基准测试以及内部能力和业务基准测试,支持从公开基准测试到现实部署场景的系统性评估。 - • 全面实验表明,Yuvion LLM优于开源和专有基线。Yuvion-32B在内容安全上达到78.2%的宏F1(对比GPT-5.4的72.2%),在工业部署上达到86.1%(对比GPT-5.4的80.6%)。这种优势也具有规模效率:尽管尺寸较小,Yuvion-8B在多项安全任务上超越了大多数最先进的基线,包括显著更大的模型如GPT-5.4和Qwen3-MAX,表明有针对性的对抗性和智能体安全训练可能比单纯模型规模更重要。 ## 2 面向内容安全的数据系统 ### 2.1 概述 Yuvion的一个核心前提是,有效的安全建模不仅需要专用的训练流程,还需要一个与真实世界安全任务的对抗性和操作性本质相一致的数据系统。与通用语言建模不同,面向安全的数据必须不仅支持常规的风险理解和识别,还要支持基于策略的判断、对抗性鲁棒性和智能体安全行为。这一点尤其重要,因为Yuvion不仅设计用于显式内容分类,还用于恶意意图可能被模糊化、重新表述或嵌入多步交互的现实场景。为支持这些需求,Yuvion在一个多源数据系统上进行训练,涵盖通用、安全专用、对抗性、智能体以及合成或专家构建的数据。我们不将所有样本视为单一同质语料库,而是按功能角色组织数据,以便不同类型的数据在训练流程中支持能力形成的不同方面。 ### 2.2 数据类别 表1 (https://arxiv.org/html/2606.27632#S2.T1)总结了Yuvion中使用的主要数据类别。概括而言,该数据系统旨在平衡五个目标:保持通用语言能力、加强安全领域知识、提高对抗性输入的鲁棒性、支持智能体能力,以及扩大长尾和复杂场景的覆盖范围。 | 数据类型 | 主要作用 | 代表性内容 | |----------|----------|------------| | 通用数据 | 保持广泛语言能力并稳定安全适配 | 通用指令遵循、问答、推理、阅读理解及其他常见语言任务等 | | 安全领域数据 | 构建核心安全知识和任务能力 | 风险理解与识别、层级式安全分类、基于策略的判断、基于证据的响应等 | | 对抗性数据 | 提高对规避性和模糊化不安全输入的鲁棒性 | 词汇变体、符号或谐音替换、语义伪装、情境伪装及其他策略规避表达等 | | 智能体数据 | 支持涉及推理、检索和工具交互的多步安全工作流 | 工具使用轨迹、基于搜索的推理、多步分解、检索增强决策等 | | 合成与专家构建数据 | 扩展长尾覆盖并为复杂任务提供高质量监督 | 罕见或困难场景、策略密集型案例、结构化推理样本、偏好数据、面向奖励的优化数据等 | 表1:Yuvion面向安全数据系统中主要数据类别概览。 ##### 通用数据。通用领域数据用于保持广泛语言能力并减少安全适配过程中的过度专业化。尽管此类数据并非安全专用,但通过帮助模型保持通用指令遵循、理解和推理能力,它起到了重要的正则化作用。 ##### 安全领域数据。安全领域数据构成了Yuvion安全能力学习的核心。它涵盖了广泛的安全相关任务,包括风险理解、风险识别、策略敏感分类、证据归因和结构化决策生成。与传统安全分类数据相比,这部分更强调丰富的监督和策略依据,使模型不仅能够输出标签,还能在需要时生成更具可解释性和策略一致性的响应。 ##### 对抗性数据。由于安全本质上是对抗性的,Yuvion数据系统包含一个专门的对抗性子集,明确建模现实的规避模式。这些数据涵盖表层形式扰动和更深层次的语义隐藏策略,帮助模型避免过度依赖浅层词汇线索,提高对模糊化恶意意图的鲁棒性。 ##### 智能体数据。引入智能体数据是为了支持需要超越单轮分类的安全场景。该类目涵盖涉及多步推理、检索、工具调用以及基于动作的响应的结构化轨迹。它提供训练信号,用于分解复杂任务、选择合适的工具、与外部系统交互,以及将中间观察综合成有依据的决策。在Yuvion中,此类数据对于后期优化现实安全场景尤为重要。 ##### 合成与专家构建数据。引入合成与专家构建数据是为了改进对罕见、高风险、长尾或结构化场景的覆盖。
相似文章
@pallavishekhar_: https://x.com/pallavishekhar_/status/2058460434035060758
解释大型语言模型实际所做的工作(下一个Token预测),以及为什么即使出错时它们听起来也很有信心。提供了一种心智模型和验证检查清单,用于安全使用LLM。
(迈向)使用大型语言模型的可扩展可靠自动化评估
本文提出了一种可扩展、领域无关的自动化 LLM 评估框架,该框架利用多个 LLM 的成对比较和 Elo 评分系统来近似专家判断,从而减少人工干预的需求。
多模态大语言模型安全格局的演变:新兴威胁与防护措施综述
一篇综述论文,系统分析了多模态大语言模型不断演变的安全格局,涵盖了对抗性攻击、数据投毒、越狱和幻觉等新兴威胁,并回顾了更新后的安全策略。
PolicyAlign: 基于直接策略的大型语言模型安全对齐
PolicyAlign 提出了一种框架,通过合成指令生成和在线策略自蒸馏,直接将大型语言模型与自然语言安全策略对齐,在不依赖昂贵监督数据的情况下提升安全性。
理解大型语言模型
本章回顾了当前对大型语言模型的理解,讨论了它们的Transformer架构、类似人类认知的涌现能力,以及关于LLM是真正理解还是仅仅模拟理解的争论。