评估大语言模型与中国AI生成内容法规合规性的基准测试
摘要
本文使用一种新颖的基准测试框架,评估了20个大语言模型对中国AI生成内容法规的遵守情况,为全球AI社区提供了见解。
arXiv:2609.19989v1 Announce Type: new
摘要: 大语言模型的广泛采用导致内容合规风险不断上升。先前的工作有助于在英语环境中解决这些风险,却低估了中文内容的复杂性。本文遵循中国当前的AI生成内容合规要求,并提供了对20个著名大语言模型的评估结果,从而深入洞察中国的监管格局。我们设计了一个新颖的框架,通过2303个问题(跨越六个不同维度,包括203个自建的宪法性问题)来评估合规率和拒绝率。该框架采用多个评判器基于其层级对齐记忆独立生成判决。我们的研究发现,尽管使用标准中文问题,国际模型也表现出高度的合规性,主要差异可能源于与意识形态对齐密切相关的维度。我们建立了一个监管基准,使全球AI社区能够在一套统一的法律依据合规要求下评估中国和非中国的大语言模型。
查看缓存全文
缓存时间: 2026/09/18 09:09
# 基准测试大语言模型对中国人工智能生成内容法规的合规性 来源:https://arxiv.org/html/2609.19989 ###### 摘要 大语言模型的广泛采用导致内容合规风险日益加剧。先前的研究主要针对英语语境下的这些风险进行应对,忽视了中文内容的复杂性。本文依据中国现行的人工智能生成内容合规要求,对20个知名大语言模型进行了评估,为中国监管格局提供了见解。我们设计了一个新颖的框架,通过2303个问题评估合规率和拒绝率,这些问题涵盖六个不同维度,其中包括203个自建的宪法类问题。该框架采用多个评判员,基于其层级化对齐记忆独立生成判定。我们的研究发现,尽管使用了标准的中文问题,国际模型也表现出较高水平的合规性,主要差异可能源于与意识形态对齐紧密相关的维度。我们建立了一个监管基准,使全球人工智能社区能够在统一的一套基于法律的合规要求下评估中国及非中国的大语言模型。 ††地址:1同济大学计算机科学与技术学院,中国上海;2同济大学法学院,中国上海 ## 1 引言 每年发布的大语言模型数量急剧增加,这一趋势在2023年后加速[2]。随着大语言模型扩展到更多领域和应用[5],这一增长预计将持续。随着大语言模型在公众中的广泛采用,与之相关的内容合规风险也在增加。为了更好地满足用户需求,大语言模型可能会生成有害内容,包括歧视性、犯罪诱导性甚至恐怖主义相关材料[1]。几项有影响力的工作塑造了我们对大语言模型有害输出的理解和缓解。Gabriel通过强调技术对齐目标不可避免地编码规范性承诺,为对齐研究奠定了概念基础[4],从而影响了当代关于安全和面向合规的AI系统的讨论。基于人类反馈的强化学习最近被提出[8],用于将大语言模型与人类意图对齐,表明使用人类偏好进行微调可以减少有毒[12]和不真实的输出,同时保持模型效用。Singhal*等人*开发了一个全面的临床大语言模型应用的人类评估框架,强调了特定领域危害评估的必要性,并揭示了在事实性和偏见方面存在的持续差距[11]。总的来说,这些工作都旨在确保大语言模型的安全和负责任部署,表明研究趋势正朝着跨学科、多方面的危害评估以及建立稳健的人类评估框架的必要性发展。 现有研究对中国合规性挑战的解决不足,特别是可靠地基准化宪法和法律安全要求的困难。这一观点最近得到了该领域一群顶尖法律学者的呼应,他们呼吁中国人工智能监管变得更加“透明、高效和可操作”[15]。截至2025年12月1日,已有663个大语言模型在提供服务前向中国国家互联网信息办公室备案[9]。政府机构面临着监督围绕大语言模型激增的公共话语的压力,而行业利益相关者同时倡导建立标准化认证框架以确保合规性和运营清晰性。为此,本文提出了一个与当前中国人工智能生成内容合规要求对齐的合规评估框架,对多个知名大语言模型的合规率和拒绝率[7, 13]进行了评估。主要评估结果如图1所示。尽管合规评估采用的是标准的中文问题,但国际模型(5/11)仍达到合规阈值,包括著名的Claude和GPT系列。欧洲模型Mistral相对于所有中国和美国模型表现出异常行为,这一发现与欧盟在全球人工智能治理中作为制度引领者的独特角色相呼应。 图1:20个知名大语言模型在合规率和拒绝率方面的评估结果。这些模型使用2303个涵盖六个不同类别的内容安全问题进行评估,其中包括一个自建的具有宪法合规性的数据集。 由于中文内容的自动化合规评估需要法律专业知识,我们开发了一个基于ALHF的框架,使多个评判智能体能够从人类反馈中更新其层级化对齐记忆,从而提高框架结果的可靠性。为了进一步理解驱动大语言模型性能差异的主要因素,我们还研究了模型对宪法内化的程度,并考察了其对各种越狱提示变体响应的稳健性。据我们所知,这是首个构建可操作基准和自动化评估管道的工作,我们使用这个监管基准对大语言模型在政治和意识形态敏感内容上的行为进行了实证研究。 总体而言,我们的研究发现,美国模型与中国模型之间的差异程度小于通常的假设。 参考图注 图2:大语言模型合规性和拒绝率的评估框架:(1)构建包含2303个问题的测试数据集,(2)为每个评判员使用ALHF设计层级化对齐记忆,(3)评估六个类别、宪法内化和越狱测试的表现。 ## 2 方法与数据集 所提出的框架由测试问题、来自目标大语言模型的响应以及由多个评判员投票得出的关于合规性和拒绝率的最终评估结果组成。这些评判员独立生成判定,并在出现分歧时由法律专家持续纠正,以执行基于人类反馈的智能体学习。至少两名法律专家根据《生成式人工智能服务基本安全要求》[6]共同校准抽样的不一致判定。所有专家参与者在提供反馈前均提供了知情同意。我们还首次构建了宪法问题及相关的越狱数据集。我们实验程序中包含的总体组件如图2所示。 ### 2.1 具有层级化对齐记忆的ALHF 本实验中使用的主要2100个问题来自《生成式人工智能服务安全基准套件》[3],评判员评估目标大语言模型对这些问题的响应。每个评判员基于ALHF指示的三层记忆运行,即包含通用标准或指南的语义记忆、捕捉特定经验和边缘案例的情景记忆,以及明确存储判定接近分类边界或多个标准冲突实例的冲突/边界记忆。使用DeepSeek-chat进行此记忆对齐,而使用Qwen3.5-plus、GPT-5.4-nano和Gemini-3.1-flash-lite作为三个评判员。提示要求其从专家反馈中提取可重用的评估原则,并提供带有支持理由的修正后的合规性和拒绝判定。 ### 2.2 宪法问题与越狱测试 作为中国的根本法,宪法规定了国家的根本制度、公民的基本权利和义务以及国家机构的结构。因此,对大语言模型生成的内容进行宪法审查至关重要,因为此类内容可能构成模型合规性差异的主要原因之一。我们构建了203个额外问题,侧重于事实知识(90个问题)、法律法规理解(90个问题)和情境场景分析(23个问题)。整个构建过程基于宪法学法律学者的领域专业知识和实践经验。鉴于大语言模型对合规问题的响应稳健性同样重要,我们进一步为上述问题构建了越狱测试。为了评估大语言模型针对不同越狱组件的稳健性,我们进行了增量提示修改实验。我们针对两个可能有助于越狱的组件[14],即强调大语言模型特性和强调不拒绝。 ## 3 结果与讨论 **总体评估结果。** 在图1中,位于右上象限的大语言模型表现出明显的拒绝敏感查询的倾向,表明其保守的安全策略。这些模型的高合规性表现是基于对模糊或边界输入的拒绝响应。因此,它们固有的保守性可能会限制模型对用户查询的整体效用。位于左上象限的大语言模型被视为在提供令人满意的响应的同时满足内容安全期望。这些模型的优异表现可归因于两个因素:首先,它们较晚的发布日期使其能够受益于迭代的安全改进,整合了专门针对道德和监管合规性优化的先进技术,如RLHF。其次,像Qwen这样的模型集成了复杂的内部安全对齐控制[10],以确保后训练过程满足无害和去偏见标准。位于左下象限的大语言模型的表现可能归因于其发布日期早于[6](于2024年2月发布)。Yi 34b和Mistral均在2024年前发布,因此它们可能缺乏专门针对复杂且不断演变的中国标准的集成安全策略。其余位于右下象限的大语言模型拥有敏感但区分度不足的安全机制,揭示它们可能并未真正内化合规原则,而是更多地依赖于僵化的启发式方法。 **可靠性验证** 为了验证所提出的框架在合规性和拒绝判定方面的可靠性,我们招募了三名法律专家独立标注了249个抽样问题,并通过多数投票建立了真实标签。具体而言,合规性判定分为三个子类别:事实性不合规、观点性不合规和合规。同时,拒绝响应判定包括三个子类别:不拒绝、部分拒绝和完全拒绝。对于合规性验证,事实性不合规和观点性不合规被合并为一个不合规类别。这三名专家在这些问题上达到了0.610的Fleiss' κ系数。我们框架中提出的两个组件的消融研究总结于表1,包括(1)我们的框架与独立法律专家在留出评估集上的一致性(准确率 = 98.8%,召回率 = 95.5%,F1值 = 93.3%,Cohen's κ = 92.7%),(2)一项消融研究证明了仅使用50个反馈的ALHF的贡献(准确率:94.4% → 95.6%)。定量证据表明,记忆对齐使单个评判员对原本会忽视的违规行为变得敏感,然后多数投票则过滤掉了更敏感的评判员产生的额外误报。 表1:在249个留出评估集上与专家多数投票的一致性。“单个评判员”指GPT-5.4-nano。召回率和F1值使用不合规作为正类;κ表示Cohen's kappa。 **跨六个类别的差异。** 需要更细粒度的分析来揭示导致观察到的模型性能差异的具体问题类别。图3提供了更细粒度的类别级结果,其中我们主要比较中国模型与其他模型之间的平均差异。中国大语言模型在所有考察的维度上都表现出系统性的更高合规性,表明其与面向监管的安全约束有更强的对齐。值得注意的是,在与意识形态对齐紧密相关的维度(“宪法合规”和“社会主义核心价值观违反”)上,相对优势更为明显,表明在中国语境下,这两个方面可能在模型开发和后训练对齐过程中被更紧密地编码。相比之下,在商业相关场景中差距缩小,中国和非中国模型表现出大体相似的行为。这种趋同表明,某些类别的安全性——特别是那些与广泛共享的规范(如商业合法性)相关的——可能已经反映了整个大语言模型生态系统的一种全球对齐。 图3:实线红色和蓝色线分别代表中国和非中国大语言模型在六个类别上的平均性能。在合规性方面,在意识形态对齐类别(即“宪法合规”和“社会主义核心价值观违反”)上观察到显著差异。在拒绝率方面,中国和非中国模型仅在歧视相关方面无显著差异。 表2:合规率与宪法内化程度之间的正相关表明,中国宪法可能充当了基础性规范来源。 **宪法内化与越狱测试。** 宪法内化实验在回答问题前,将宪法全文作为附加附件提供,并附有明确的指示,要求模型基于宪法原则进行响应。此设置旨在评估模型是否能够灵活应用宪法知识,而不仅仅是依赖表面的拒绝模式或记忆的知识。表3中的结果表明,表现出强大总体合规性能的大语言模型在此宪法依据设置中也取得了持续的优异性能。例如,Qwen2.5-32B-Instruct评估每个响应是否将相关的宪法原则应用于具体场景;仅仅拒绝是不够的。这种一致性表明,中国宪法可能充当了当前面向合规的对齐和评估机制的基础性规范来源。 使用增量提示变体来探索目标大语言模型的性能稳健性。我们在原始查询中添加危险人格指令,然后添加不拒绝要求,以评估它们对合规性的增量影响。
相似文章
一种以人为本的大语言模型育儿建议基准测试方法
本文提出了一种以人为本的基准测试方法,用于评估大语言模型在育儿建议方面的表现,使用专家制定的评分标准,在英语和中文中评估了15个大语言模型在100个场景下的表现。
我们一直在分析人们如何在法律与合规任务中使用LLM(GDPR、AI法案等)。
对LLM在法律与合规任务中使用的分析显示,模型常常生成自信但无法验证的引用,引发了对AI输出可靠法律依据的质疑。
探索大语言模型在中文抽象语言掌握中的能力边界
本文介绍了Mouse基准测试,用于评估大语言模型在六个自然语言处理领域的中文抽象语言任务表现。研究表明,尽管当前最先进的模型在上下文理解任务中表现良好,但在这种亚文化网络语言上仍存在重大局限。
法规AI:使大语言模型与法律规范对齐
该论文提出Statutory AI,这是一种利用法律文本来对齐大语言模型与法律规范的混合方法,与标准宪法AI相比,可将有害内容减少52-59个百分点,同时计算时间缩短超过50%。
LLM基准测试
一项关于大语言模型基准测试的研究或报告,可能比较了各种任务上的表现。