神经符号AI用于LEED合规:以文档为中心的基准测试、确定性数值检查以及多模态何时有害
摘要
本文介绍了一种神经符号流水线,用于自动化LEED v4.1 BD+C合规性验证,使用小型本地部署的语言模型和确定性数值检查。在四栋大学建筑上的实验表明,4B模型优于8B模型,确定性检查器纠正了关键得分点上的算术错误,尽管多模态输入会降低准确性。
arXiv:2607.15647v1 Announce Type: new
摘要:LEED v4.1 BD+C认证仍然是一个文档密集型过程,要求审阅者手动阅读数百页的项目证据并应用特定得分点的阈值逻辑。本文研究小型本地部署的语言模型是否能够对LEED文档进行有意义的筛选,以及确定性符号组件应如何分担这项工作。我们引入了一种神经符号流水线,将项目PDF对齐到LEED得分点章节,使用得分点感知的关键词签名检索证据,通过本地托管的40亿参数语言模型验证合规性,并对定量阈值应用LEED特定的数值检查器。在四栋大学建筑(484个PDF,153个得分点级别决策)上的实验表明,40亿参数模型(gemma3:4b)是最强的纯文本核心验证器,准确率达到67.3%,在此任务上优于更大的80亿参数模型(llama3.1:8b)。确定性数值检查器纠正了关键定量得分点上的算术错误,将EA-p2的准确率从50%提升到100%,并在可靠提取所需值时改善了几个其他得分点。同时,完整的神经符号配置达到了61.6%的整体准确率,由于提取失败和对定性类别的保守行为,落后于最佳纯文本基线。系统的消融实验表明,添加低分辨率图纸图像(150-300 dpi)会持续降低准确率,且提示有效性取决于建筑物的真实PASS率:评分标准提示在文档丰富的项目上表现最佳,而思维链提示在文档稀疏的项目上表现最佳。在LEED v4.1 BD+C合规性验证的特定范围内,该流水线及其基线为准确性和失败模式提供了初始的可重复参考点。
查看缓存全文
缓存时间: 2026/07/20 09:22
# 用于LEED合规性的神经符号AI:以文档为中心的基准测试、确定性数值检查以及多模态何时有害 来源:https://arxiv.org/html/2607.15647 1]机构=德克萨斯大学奥斯汀分校,地址行=,城市=奥斯汀,城市分隔符=,邮编=78712,州=德克萨斯,国家=美国 ###### 摘要 LEED v4.1 BD+C认证仍然是一个文档密集型过程,要求审核员阅读数百页的项目证据,并手动应用针对信用的阈值逻辑。本文研究了小型本地部署语言模型是否能够对LEED文档进行有意义的筛选,以及确定性符号组件应如何分担这项工作。本文引入了一个神经符号流水线,它将项目PDF对齐到LEED信用章节,利用信用感知关键词签名检索证据,使用本地托管的40亿参数语言模型验证合规性,并对定量阈值应用LEED特定的数值检查器。在四栋大学建筑(484份PDF,153个信用级决策)上的实验表明,一个40亿参数模型(gemma3:4b)是最强的纯文本核心验证器,准确率达到67.3%,在此任务中优于更大的80亿参数模型(llama3.1:8b)。确定性数值检查器纠正了关键定量信用上的算术错误,将EA-p2从50.0%准确率提升至100.0%,并在可靠提取所需值时改进若干其他信用。同时,完整的神经符号配置实现了61.6%的整体准确率,由于提取失败和在定性类别上的保守行为而落后于最佳纯文本基线。系统的消融研究表明,添加低分辨率图纸图像(150–300 dpi)持续降低准确率,提示有效性取决于建筑物的真实通过率:基于规则提示在文档丰富的项目上表现最佳,而思维链提示在文档稀疏的项目上表现最佳。在LEED v4.1 BD+C合规性验证于原始项目文档的特定范围内,该流水线及其基线为准确性和失败模式提供了初步的可重复参考点。结果支持实用的设计:使用强大的本地纯文本模型作为默认验证器,选择性地为高影响定量信用添加确定性数值检查,根据预期文档强度调整提示,并将提取视为首要工程前沿。 ###### 关键词:LEED v4.1 BD+C\sep自动合规性检查\sep神经符号AI\sep大语言模型\sep可持续建筑 \{亮点\} 首次提出针对LEED v4.1 BD+C合规性且基于真实项目文档的神经符号流水线,包含信用章节感知分块和智能体检索。 实现了一个LEED特定的确定性数值检查器,纠正高影响定量信用上的算术错误,包括EA-p2从50%准确率提升至100%。 在四栋UT Austin建筑上对本地部署的小型语言模型进行基准测试,显示4B模型优于8B模型,并记录了提示对类别不平衡的敏感性。 提供了系统的多模态和提取消融研究,证明低分辨率图纸图像和不完美的数值提取会降低准确性,并明确了符号和神经组件失效的位置。 ## 1 引言 获得能源与环境设计先锋(LEED)体系认证的建筑必须经历一个劳动密集型的文档审查过程,该过程依赖于大量的数据处理、模拟输出和文档审查(lee_integrated_2025)。审查员随后必须将异构的项目提交材料与每个尝试信用的要求对齐,使得认证既是证据匹配任务,也是设计评估任务(feijao_comparative_2024)。 建筑领域对自动合规性检查的研究已有数十年历史,始于将法规翻译为机器可读逻辑的基于规则的系统。自动合规性检查已从僵化的基于规则引擎发展为混合系统,结合了符号逻辑、BIM和NLP。早期工作将法规条款翻译为可计算规则,但这些方法需要大量人工形式化,且难以跨辖区适应。最近的NLP工作旨在从法规文本中提取语义元素和关系,以便更灵活地生成规则(zhang_semantic_2016;hettiarachchi_code-accord_2025;lee_automated_2026;mirhosseini_systematic_2026)。2026年一篇关于在自动合规系统中解释建筑规范方法学的系统综述发现,该领域正朝着结合语言理解与结构化检查流水线的混合架构发展(mirhosseini_systematic_2026)。相关工作表明,深度学习和基于语法的解析在从复杂句子中提取法规逻辑方面,可以优于传统手工方法。同时,贯穿建筑生命周期的自动合规性检查仍受限于文档复杂性、数据异构性以及将自然语言转化为可靠可计算证据的挑战(hettiarachchi_code-accord_2025;lee_automated_2026)。 最近的研究已开始直接将LLMs应用于合规工作流。与BIM关联的系统已使用GPT、Claude、Gemini和Llama来解释规范要求并在设计环境内生成半自动化检查程序(madireddy_large_2025)。美国能源部也已探索AI辅助的能源规范合规性验证,将规范检索与问答界面配对以支持更透明的审查(wan_exploring_2025)。关于LEED自动化的新兴研究表明,AI可以减少与该过程相关的时间和精力。一个最近的LEED认证自动化集成平台报告称显著减少了文档工作量,但它更侧重于自动化架构而非严格的跨建筑、信用级基准测试(lee_integrated_2025)。这就留下了一个核心研究问题:当要求对实际项目提交材料中的信用证据进行验证时,一个小型本地模型实际能达到多高的准确率? 检索增强生成现在是回答特定领域语料问题的标准方法(oche_systematic_2025)。但具有稳定且专业词汇的特定领域语料通常更偏向高精度关键词检索(jadon_enhancing_2025)。自一致性也是相关的。先前工作表明,生成多个推理路径并选择多数答案可以减少随机误差并提高可靠性(taubenfeld_confidence_2025;huang_mirror-consistency_2024)。校准研究同样表明,更大的模型并不总是表现更好(michael_confidence_2026)。过度自信和幻觉仍然是严重问题,尤其是当模型因始终给出答案(而非在证据薄弱时弃权)而得到奖励时(kalai_why_2025;geng_survey_2024)。这些担忧直接映射到LEED审查,因为正确答案往往不是PASS或FAIL,而是证据不足。 这项工作做出了三项具体贡献。第一,它提出了一个用于LEED v4.1 BD+C合规性验证的神经符号框架,该框架操作于真实项目文档,而非精选的BIM或IFC模型。该流水线将异构PDF与信用章节对齐,使用信用感知签名检索证据,并将叙述性推理与确定性阈值检查分离。第二,它定义并实现了一个LEED特定的数值检查器,编码定量阈值和积分表,并表明将算术与语言分离可提高高影响信用(如EA-p2)的正确性。第三,它开发了一个多建筑基准测试,用于LEED文档级自动合规性检查,报告了每个类别的准确率、多模态消融、提示敏感性分析以及包含神经和符号组件之间积极和消极相互作用的错误分类。总的来说,这些贡献将LEED合规性从通用语言模型的黑盒应用转变为结构化的、可检查的基线,以支持方法学的累积发展。在LEED v4.1 BD+C合规性验证于原始项目文档的特定范围内,该流水线及其基线,根据现有最佳证据,提供了迄今为止最完整的已发表处理。由于缺乏先前的神经符号系统或用于LEED文档中心自动合规性检查的开放基准,该研究建立了一个初步的可重复参考点,包括定量准确性和对失败模式的定性分析。 ## 2 方法论 ### 2.1 研究设计与流水线概述 本研究开发并评估了一个神经符号系统,用于验证项目文档是否支持LEED v4.1建筑设计与施工(BD+C)要求的合规性。该系统针对绿色建筑认证中一种困难但常见的情况而设计:证据分布在一组异构的非结构化文档中,包括叙述、时间表、能源报告、调试计划、材料提交文件、建筑废弃物报告和图纸。该系统不假设项目证据已转换为完整的BIM模型或规范化数据库。它从项目团队实际提交的文档开始。 核心设计原则是关注点分离。语言模型用于需要上下文解释的任务:定位潜在相关文本、提取证据、识别数值并解释决策。确定性规则引擎用于需要精确算术或阈值比较的任务。这种分离很重要,因为一个看似合理的语言模型解释并不能保证正确的数值结论。在所提出的流水线中,模型可能识别出能源模型的结果,但它不决定报告值是否达到相关的LEED阈值。数值检查器来完成这项工作。 图1 (https://arxiv.org/html/2607.15647#S2.F1) 总结了七阶段流水线。该过程首先构建LEED提交目录的可搜索表示。然后识别特定信用的文档章节,检索候选证据,获取结构化的语言模型评估,应用校准的晋升和确定性数值检查,并返回可追溯的最终结果。每个结果包含一个判决、置信度评分、证据引用、缺失证据元素、数值以及确定性逻辑是否改变了原始模型决策的记录。 令建筑b的输入语料表示为 D^(b) = {d_1, d_2, ..., d_N}, (1) 其中每个d_i是与该建筑相关联的PDF文档。对于每个LEED信用c ∈ L(其中L是评估的信用集),目标是产生最终判决 ŷ_(b,c) ∈ {pass, fail, insufficient_data}。 (2) 系统从检索到的证据E_(b,c)、语言模型评估z_(b,c)、校准的晋升函数P(·)以及在适用情况下的确定性规则函数R_c(·)产生此判决: ŷ_(b,c) = R_c( P(z_(b,c), τ_b), E_(b,c) ). (3) 晋升阈值τ_b可以是全局固定的,也可以使用保留的开发数据进行校准,如第2.7节所述。规则函数R_c(·)仅在能够确定明确的pass或fail结果时才替换语言模型的判决。如果规则引擎无法恢复所需的值或建立有效的比较,则保留先前的语言模型判决。 参见图注 图1:神经符号LEED验证流水线。该流水线将异构项目文档转化为信用级判决。语言模型执行检索引导的证据解释和值提取。符号检查器应用确定性的信用特定阈值逻辑。检查器仅在返回确定的PASS或FAIL判决时覆盖语言模型的结果。 ### 2.2 文档摄取与结构索引 LEED项目提交不是文件的扁平集合。它们通常保留由项目团队、顾问或LEED管理员创建的部分组织性结构。这种结构通常包括顶层类别文件夹,如能源与大气(EA)、节水(WE)、可持续场地(SS)、材料与资源(MR)、室内环境质量(EQ)、创新(IN)和区域优先权(RP)。在这些文件夹内,项目团队经常为单个先决条件或信用创建子目录。由此产生的层次结构提供了有用但不完美的元数据。有用是因为文件夹位置可以缩小检索空间。不完美是因为团队使用不一致的缩写、旧名称和非标准目录标签。 StructureIndex将此异构目录结构转换为规范化的层次结构: `` 建筑 -> LEED类别 -> 子信用文件夹 -> PDF文档 -> 页面文本和元数据 `` 每个PDF使用PyMuPDF (fitz)处理。摄取阶段提取页面级文本、页数、源文件名、绝对和相对路径、可用时的文档标题以及文件级元数据。提取的文本本地缓存,以便后续检索操作不需要重复的PDF解析。缓存很重要,因为单个建筑可能包含超过一百个文档,否则重复提取将主导运行时间。 对于每个文档d_i,索引存储结构化记录 I(d_i) = [t_i, p_i, m_i, g_i, s_i], (4) 其中t_i是提取的全文,p_i是页面级文本和页数,m_i是文件元数据,g_i是从目录路径推断的规范化LEED类别,s_i是从源目录或文件名推断的候选子信用标签。 类别规范化步骤将目录名称映射到规范的LEED类别代码。映射有意保守。直接匹配如EA、WE、SS和MR被保留。遗留或特定项目的标签仅当对应关系明确时才翻译。例如,ID映射到创新(IN),IQ映射到室内环境质量(EQ),PI映射到整合过程(IP)。表1 (https://arxiv.org/html/2607.15647#S2.T1) 列出了研究中使用的完整映射。 表1:结构索引使用的目录到类别规范化。 | 目录标签 | 规范类别 | 解释 | |---------|---------|------| | EA, WE, SS, MR | EA, WE, SS, MR | 直接类别匹配 | | LT, IN, IP, RP | LT, IN, IP, RP | 直接类别匹配 | | ID | IN | 创新与设计缩写 | | IQ | EQ | 室内环境质量缩写 | | PI | IP | 过程与整合过程缩写 | 规范化类别用作检索先验。对于属于类别g(c)的目标信用c,首轮搜索空间为 D_(g(c)) = {d_i ∈ D^(b) | g_i = g(c) or g_i 近似匹配}.相似文章
面向数据敏感领域的LLM输出的神经符号验证(扩展预印本)
本文提出了一种针对高风险领域LLM输出的神经符号验证架构,结合形式化符号方法与神经语义分析。在一个医疗器械损伤评估系统上进行的评估显示,该架构对结构化实体的幻觉检测率超过83%,语义虚构的检测率达72%,报告创建时间缩短30%。
AI能否像城市规划师一样推理?基于专业判断对大型语言模型进行基准测试
本文介绍了UPBench,这是一个基准测试,用于评估大型语言模型在城市规划知识方面的表现,涵盖四个知识支柱和五个认知层次。研究发现,模型在高阶分析任务上表现优于事实回忆,并识别出如监管幻觉和实践智慧缺失等认知局限。
BIM-Edit:基于IFC的建筑信息模型的大语言模型基准测试
BIM-Edit是一个基准测试,用于评估大语言模型在IFC格式下对建筑信息模型(BIM)进行自然语言编辑的能力。结果显示存在显著差距,最佳模型在几何、语义和拓扑指标上的平均得分仅为49.5%。
推理者还是翻译者?税法中的污染感知评估与神经符号鲁棒性
本文实证研究了LLMs在税法中的法律推理,表明数据污染会夸大性能,而神经符号混合系统比单体LLMs提供更可靠和稳健的泛化能力。
面向住宅建筑平面图合规检查的自动化AI框架
本文提出了一个基于人工智能的概念框架,利用大语言模型和计算机视觉将建筑规范转化为可执行的规则,并评估结构化的建筑图,从而实现建筑平面图的自动合规检查。