面向低资源土石堤坝检查的多条件扩散合成沙沸图像

arXiv cs.AI 论文

摘要

本文提出了一种基于多条件扩散的合成流程,使用Stable Diffusion XL和ControlNet生成合成沙沸图像,用于低资源土石堤坝检查,解决标注缺陷样本稀缺的问题。

arXiv:2607.08794v1 公告类型:交叉 \n摘要:土石堤坝上的沙沸是一种安全关键缺陷,但像素级检测受限于稀缺的标注。我们提出了一种基于扩散的合成流程,用于低资源沙沸图像。该流程使用经DreamBooth微调并通过多分支ControlNet堆栈条件化的Stable Diffusion XL,从一个小型精选参考集生成合成检查图像。一种软掩码修补协议保留了真实缺陷像素,同时重新渲染周围场景,避免了先前无缝克隆合成中的接缝和颜色偏移。一个掩码条件化的ControlNet还可以在选定掩码内生成新的沙沸,使掩码本身成为分割标签;然而,由于使用可用真实训练门进行大规模标签认证仍未解决,我们默认发布软掩码预设。文本条件化由一个基于分类学的Prompt Atlas提供,该Atlas将一个领域规范扩展为分层的、CLIP验证的提示库,并无需代码更改即可转移到新的缺陷类别。从真实训练图像中,该流程生成了1,020个合成候选,其中815个通过了CLIP可接受性过滤器。我们使用分布性和保真度-多样性指标与真实参考集及泊松基线评估图像质量,并审计分布外漂移和记忆化。没有单一的预设占主导地位;每个预设都在保真度、多样性和标签可靠性之间有所权衡。因此,我们将标签可靠预设作为默认发布,并将精选混合视为自然增强集。我们的声明仅限于图像质量、标签来源和多样性;下游分割留待未来工作。代码和工件清单已发布以供可重复性。
查看原文
查看缓存全文

缓存时间: 2026/07/13 07:56

# 多条件扩散合成沙沸图像用于低资源土堤检查  
来源:https://arxiv.org/html/2607.08794  

Padam Jung Thapa¹, Abdullah Bin Naeem², Ayon Dey², Anav Katwal², Md Tamjidul Hoque²,\*  
¹路易斯安那大学拉斐特分校, 拉斐特, LA, 美国  
²计算机科学系, 路易斯安那州立大学新奥尔良分校, 新奥尔良, LA, 美国  
电子邮箱:[email protected]; {aneem, adey, akatwal, thoque}@lsuneworleans.edu  
\*通讯作者:[email protected]  

###### 摘要  
土堤上的沙沸是影响安全的关键缺陷,然而从巡检图像中进行像素级检测受到标注样本稀缺的限制。我们通过基于扩散的合成流程来解决这一低资源场景。以Stable Diffusion XL为骨干,在小型精选参考集上通过DreamBooth微调,并由多分支ControlNet堆栈进行条件控制,生成合成沙沸图像。软掩模修复协议逐像素保留真实缺陷区域,同时重新渲染周围场景,避免了之前使用的无缝克隆合成带来的接缝和色偏。互补的掩模条件ControlNet将新沙沸生成到选定掩模中,因此条件掩模本身就是分割标签,同时将凸包标注器重新用作漂移检查质量门——尽管大规模认证该标签尚未被现有的真实训练门解决,因此我们发布软掩模预设(而非此预设)作为默认方案。文本条件由基于分类学的提示图集提供,该图集将单个领域规范扩展为分层、CLIP验证的提示库,并可在无需代码更改的情况下迁移至新的缺陷类别。该流程从真实训练图像生成1,020个合成候选,其中815个通过CLIP可接受性筛选,形成增强数据集。我们通过分布距离、保真度/多样性度量(对比真实参考集和Poisson基线)评估图像质量,并审计增强数据集是否存在分布外漂移和记忆化。没有任何单一预设占主导地位:预设之间在保真度、多样性和标签可靠性方面存在权衡,因此我们发布标签可靠的预设作为默认方案,并将策展后的混合集视为自然增强集。我们的声明范围限定于图像质量、标签来源和多样性;下游分割任务留待未来工作。为促进可重复性,我们发布代码和工件清单。  

## I 引言  
土堤保护着大量人口和财产免受洪水侵袭,然而其状况难以大规模监控。2005年卡特里娜飓风导致的溃堤事件充分暴露了巡检不足的代价——独立调查人员将新奥尔良的灾难性洪水归因于设计、施工和巡检的多重缺陷[46]。在巡检人员接受培训识别的缺陷类别中,沙沸尤其关键。当水在压力作用下将细砂通过透水地基向上携带时,就会形成沙沸,表现为表面出现一个小的饱和穹顶(图1)。这是内部侵蚀(也称管涌)的早期可见阶段,若不加处理,高水位事件期间可能演变为突发溃口。因此,从日常现场照片中进行像素级的沙沸检测与分割,为主动洪水风险管理提供了直接手段。  

参见标题  
图1:堤防系统的横截面解剖及其产生的表面缺陷。河中的高水位驱动*底部渗流*穿过粉土/粘土覆盖层下方的透水砂层;当水流集中时,会侵蚀出一条向上通道(*管涌*),突破覆盖层,将砂和水以*沙沸*形式排放到表面。相同的水力负载驱动堤身内潜水位*渗流线*至陆侧*渗流出逸点*,而表面劣化则表现为堤顶的*裂缝*和*车辙*。沙沸作为内部侵蚀的早期可见阶段,是本文的焦点,但生成流程可迁移至其他缺陷类别(第VII节)。  

为此任务训练深度分割模型面临一个顽固障碍:标注的沙沸图像极为稀少。该缺陷仅在高水位期间出现,分布于绵长的线性堤防网络,且需要水文学专业知识才能进行精确的像素级标注。本研究所使用的策展数据集(其规模见第III-A节)据我们所知是已报道的较大沙沸集之一。即使达到该规模,若不进行数据增强或预训练,也仍不足以训练现代分割网络。传统空间和光度增强(旋转、翻转、颜色抖动、弹性变形)会增加样本数量,但不会拓宽底层场景分布。它无法合成在文本语料库中不存在的液压机制、土壤类型或摄影风格下的沙沸。  

基于扩散的生成增强[44,51]有望填补这一空白。然而在狭窄的科学类别上实现这一目标带来了三个相互耦合的问题,本文旨在解决这些问题。  

#### 问题1:将通用扩散模型适应于狭窄缺陷类别,且无需重新训练。  
使用“一张沙沸的照片”提示的原始Stable Diffusion XL流程[41]会返回火山口、海岸浪涌或儿童沙坑的图像;预训练基础模型从未见过土木基础设施缺陷图像。在此参考集规模下,完全微调是不切实际的。采用低秩适配[45,20]的DreamBooth微调将可训练参数限制在由稀有触发令牌锚定的小型加性适配器内。该适配器可舒适地装在单个加速器上,并保留冻结基础模型用于无关提示。我们采用这一方案。我们选择SDXL而非更高容量的整流流[29]后继模型(如Stable Diffusion 3.5[14])的主要原因是其公开可用的ControlNet和IP-Adapter检查点的成熟度,我们的条件堆栈依赖这些检查点;此外我们定性观察到,在此适配器秩和数据预算下,整流流骨干更倾向于记忆单个训练帧。因此骨干的选择是深思熟虑的,而非随意默认;我们将在第III-C节系统性地审视这一点。  

#### 问题2:在保留纹理多样性的同时,将生成场景约束到真实现场参考。  
仅靠文本提示无法确定沙沸穹顶的轮廓、其相对于平坦地面的三维凸起,或饱和沉积物与干泥交界处的精细边缘纹理过渡。为此,我们在冻结的DreamBooth微调解噪器之上组装了一个由四个ControlNet分支[56]组成的堆栈:Canny边缘用于对象轮廓,单目深度[43]用于三维布局,表面法线用于穹顶-边缘浮雕,以及全嵌套边缘检测(HED)软边缘[53]用于边缘纹理。每个生产预设激活其中一个子集;选定的V4预设组合了HED软边缘、表面法线和一个IP-Adapter风格锚点。  

为了在重新渲染周围场景时不干扰真实缺陷像素,我们用软掩模修复协议替代了图像到图像步骤。将反转的真实掩模进行腐蚀和高斯模糊,形成软梯度,解噪器在每个步骤仅在该梯度内部进行预测。在扩散循环过程中,边界环被部分重新生成,因此当循环终止时,过渡已经与新的光照和颜色协商完成,避免了二进制合成中的硬边界接缝。这解决了我们早期工作[50,40]中使用的Poisson无缝克隆步骤的两个失败模式:暴露合成的硬掩模边界,以及新背景向克隆区域的颜色渗入。  

#### 问题3:生成穷举场景分布的文本条件,无需手动提示工程。  
微调后的生成器只能在提示所要求的内容范围内进行多样化。手写提示列表在不同缺陷类别间扩展性差,无法防止幻觉或分布外提示,并将增强流程绑定到编写提示的领域专家。我们用基于分类学的提示图集替代手写列表:单个JSON规范(概念、触发令牌、轴标签、参考示例、负概念列表)通过模板替换或小型开源语言模型进行扩展。然后通过长度过滤、稀疏文本相似度去重、负概念筛选以及使用CLIP相似度分数[42]与参考集进行图像-文本验证。该图集仅凭规范即可复现,且设计为可扩展至新缺陷类别(渗流、塌陷坑、车辙)而无需代码更改;本文的实证验证限于沙沸类别(第VI-E节)。  

#### 贡献。  
本文贡献了一个生成流程,其组件涵盖三个方向——缺陷保持生成、标签来源和可复现提示策展——详述如下并通过一项实证研究评估:  

- •**缺陷保持软掩模潜在混合**(第III-E节):一种每步合成规则,逐像素地精确固定缺陷的图像空间外观,同时给扩散解噪器明确自由度来协商与重新渲染周围场景的连贯过渡,消除了二进制修复和Poisson无缝克隆分别存在的硬接缝和颜色渗入失败模式。  
- •**缺陷尺寸自适应软掩模几何**(第III-E节):一种全自动尺寸缩放规则,根据缺陷的边界框几何设置软掩模的腐蚀半径和高斯核宽度,使保持边界和过渡平滑度随缺陷空间范围缩放,而无需每图手动调参。  
- •**凸包标注器**(第III-A节):一个全自动*形状感知*概率到标注流程(鲁棒阈值→连通分量→分辨率无关面积过滤→由形状因子路由的形状感知几何适配器→双栅格/多边形输出),输出单一策略训练标签*和*可编辑多边形标注。该流程根据每个分量的几何特征在凸包、形态学闭合和骨架策略之间路由,因此相同的代码路径适用于紧凑、细长和薄曲线缺陷类别(图3)。同样的机制在下文掩模条件路径中充当验证门。  
- •**具有精确标签来源的掩模条件生成**,作为零标注多样性引擎(第III-F节):一个二进制掩模SDXL ControlNet,从公开软边缘检查点微调而来,它*从*选定掩模生成图像,因此条件掩模本身就是真实标签。这消除了对外部分割器检查点的依赖(否则该检查点会限制合成标签质量),并将凸包标注器重新定位为该路径的漂移测量质量控制门。由于条件轮廓与真实来源池解耦,同一路径可从39个掩模库中渲染单沸场景,并在每个实例中添加抖动。在零标注成本下,这贡献了精确标签以及源锚定路径无法产生的形状、大小和位置多样性(图7)。我们报告其图像质量和自动认证其标签的局限性,并且在此不对其做下游分割声明。  
- •**参考集相似度质量过滤**(第III-I节):一个自动后生成过滤器,同时剔除分布外漂移*和*记忆化,可接受带自动从参考集的留一CLIP相似度统计中调优:无需人工审核,无手动选择阈值。  
- •**基于分类学的提示图集**(第III-G节):一个五阶段提示策展流程,将单个JSON领域规范扩展为分层、去重、图像-文本验证的提示库,替代临时手写提示列表,并可在无需代码更改的情况下迁移至新缺陷类别。  
- •**生成图像质量的实证评估**:分布距离(两个独立实现下的FID,含标准差的KID,CLIP图像-文本相似度,LPIPS感知多样性),以完整参考集为基准*,以及*通过改进精确率/召回率[28]和密度/覆盖率(第V-F节)进行的保真度-多样性分解,区分“看起来像”和“覆盖”参考集;生产预设比较(第V-B节);与Poisson无缝克隆基线的定量比较(第V-E节);对增强集CLIP可接受性过滤器的实证验证(1,020个合成候选中有815个被接纳),附带全局阈值保守性的逐桶诊断(第V-G节);以及CLIP空间最近参考记忆化审计(第V-H节)。生成数据的下游分割使用留待未来工作。  

这些组件并非相互独立。生成和标注组件相互锁定,为增强数据集提供单一策略掩模来源,并在输入和输出端提供自动质量边界(第III-K节),它们共同被设计为使生成数据可用于分割监督——统一标签策略、分布内过滤——这是我们设计所追求但未在本文下游测试的特性。提示图集连同SDXL(而非整流流后继模型,第III-C节)的选择,使得通过单一JSON规范在不同缺陷类别间移植成为可能;移植完整流程还需要新的DreamBooth适配器和结构条件源,因此我们描述为“设计用于移植”而非在第二类别上已演示。  

#### 与先前工作的关系。  
本流程建立在我们早期的论文[50]基础之上,我们在此界定边界……

相似文章