DiffoR:一种用于通用序数回归的统一连续生成框架

arXiv cs.LG 论文

摘要

DiffoR 提出了一种利用扩散模型进行序数回归的新型连续生成框架,克服了离散方法的局限性。在12个基准数据集上的大量实验表明,该方法在四个领域均达到了最先进的性能。

arXiv:2606.07599v1 公告类型:新 摘要:序数回归(Ordinal Regression, OR)旨在预测具有内在顺序的目标值,支撑着从推荐系统到计算机视觉等多个领域的关键应用。尽管已经从朴素回归发展到基于离散化的分类和生成,现有范式仍然受到量化伪影和缺乏全局序数拓扑感知的根本限制。这些方法通常强制划定刚性边界,无法捕捉序数数据固有的非平稳语义过渡。在本文中,我们提出了一种新范式,将序数回归表述为连续生成序数回归任务。在此新范式下,我们引入了 DiffOR,这是一个统一框架,利用扩散模型通过迭代去噪恢复连续的序数值,从而实现对软语义过渡的动态学习。为了显式保留序数拓扑,我们设计了一种双解耦策略:在空间上,多尺度增量聚合将目标分解为层次化的连续增量;在时间上,动态去噪感知将去噪步骤与特征频率同步,确保稳健的由粗到细的细化。理论上,我们证明了所提出的方法可以显著增强表示能力和机制可解释性。在四个领域的12个基准数据集上进行的大量实验验证了 DiffOR 相对于最先进方法的一致性优势,建立了一个新标准,显示出作为通用序数回归通用解决方案的强大潜力。
查看原文
查看缓存全文

缓存时间: 2026/06/09 08:48

# DiffoR:面向通用序数回归的統一連續生成框架  
來源:https://arxiv.org/html/2606.07599 (2026)  

###### 摘要。  
序數回歸(Ordinal Regression, OR)旨在預測具有內在順序的目標值,是從推薦系統到計算機視覺等不同領域關鍵應用的基礎。儘管從樸素回歸到基於離散化的分類與生成已經歷了演進,但現有範式仍然從根本上受制於量化偽影以及全局序數拓撲感知的缺失。這些方法通常強制執行剛性邊界劃分,無法捕獲序數數據固有的非平穩語義過渡。在本文中,我們提出了一種新範式,將序數回歸表述為**連續生成序數回歸**任務。在此新範式下,我們引入了**DiffoR**,一個統一的框架,利用擴散模型通過迭代去噪恢復連續序數值,從而實現軟語義過渡的動態學習。為了明確保留序數拓撲,我們設計了一種**雙解耦策略**:在空間上,**多尺度增量聚合**將目標分解為分層連續增量;在時間上,**動態去噪感知**將去噪步驟與特徵頻率同步,確保從粗到細的穩健細化。理論上,我們證明了所提方法能顯著提升表示能力與機制可解釋性。在四個領域的12個基準上的大量實驗驗證了DiffoR相較於最先進方法的一致優越性,建立了一個新的標準,展示了作為通用序數回歸通用解決方案的強大潛力。  
序數回歸, 擴散模型, 連續生成學習  
††期刊年份:2026  
††版權:cc  
††會議:第32屆ACM SIGKDD知識發現與數據挖掘會議 V.2; 2026年8月9–13日, 韓國濟州島  
††書名:第32屆ACM SIGKDD知識發現與數據挖掘會議 V.2 (KDD ’26), 2026年8月9–13日, 韓國濟州島  
††DOI:10.1145/3770855.3818149  
††ISBN:979-8-4007-2259-2/2026/08  
††CCS:資訊系統 → 學習排序  

## 1. 引言  

![參閱標題]圖1. (a) 樸素分類、(b) 序數回歸與 (c) 樸素回歸的概念對比。序數回歸獨特地處理有序但非平穩的數據,不同於分類的名義性質和回歸的等距度量。  

表1. 序數回歸範式的演進。‘L’ 與 ‘A’ 分別表示‘限制’與‘優勢’。  

| 範式 | 核心機制 | 目標表示 | 內在限制 / 優勢 |
|------|----------|----------|------------------|
| 樸素回歸 | 逐點映射 | 確定性點 | L: 無法捕獲複雜序數分佈 |
| 空間離散化 | 空間量化 | 硬類別 | L: 忽略固有順序關係 |
| 基於排名 | 二元分解 | 獨立位 | L: 難以處理區間依賴性 |
| 離散生成 | 令牌自回歸 | 量化令牌 | L: 啟發式詞彙與量化誤差 |
| 連續生成 | 流形擴散 | 連續分佈 | A: 捕獲軟過渡與全局拓撲 |

預測具有內在順序的目標值,即序數回歸(OR),在計算機視覺(例如人臉年齡估計[42, 80])、醫學診斷(例如疾病分期[111])和推薦系統(例如偏好排序[1, 2, 7, 86])等領域中具有重要作用。如圖1所示,與忽略順序的分類或假設等距區間的度量回歸不同,OR必須建模非平穩的語義邊界(例如,人臉衰老中20→21歲的感知差距小於60→61歲)。這種固有的非均勻性違背了剛性離散化[139],我們在附錄A.1和A.2中從理論上驗證了這一限制。從範式演進的角度(總結於表1),早期方法大多將OR視為**樸素回歸**任務[45],嘗試通過逐點映射擬合目標,但通常無法捕獲複雜的序數分佈。隨後,**連續空間離散化(CSD)**[139, 44]成為主導範式,通過空間量化將回歸簡化為分類。其衍生方法**基於排名**[42, 1]通過二元子任務編碼順序性,但仍難以克服固有的區間獨立性與剛性預測。最近,類似於大型語言模型(LLMs),**離散生成**方法[111, 149]將OR重構為序列生成,但仍然受到啟發式詞彙設計和不可避免的量化誤差的阻礙。至關重要的是,正如我們在附錄A.2和A.3中理論所示,這些基於離散化的表述在本質上連續的序數空間中引入了確定性邊界。結果導致預測常在局部碎片化,對序數距離不敏感,並且對序數空間的全局拓撲缺乏感知,尤其是在語義轉換區域附近。儘管許多工作嘗試增強編碼器[43, 119, 3, 4, 5, 6]或處理邊界模糊性[83, 65],這些優化大多針對特定領域的症狀而非底層離散範式的內在限制,本質上仍是治標不治本,缺乏跨任務的泛化能力。  

這種情況提出了一個根本性問題:是否存在一種範式,既能規避離散化的內在限制,又能自然適應OR嚴格的順序依賴性和非平穩邊界?一個自然的替代方案是直接回歸連續目標。然而,樸素回歸將序數結構壓縮為單一標量估計,無法明確表示分層序數語義或捕獲不同尺度下的不確定性。在實踐中,粗粒度的序數等級(例如“哪個階段”)與細粒度的變化(例如“階段內的具體位置”)由不同的語義線索支配,在單一標量預測中難以解耦。  

針對這個問題,本文轉向**連續生成模型**[27, 129, 29],並認為它們在表徵複雜概率密度流形方面的卓越能力能夠實現跨領域的自適應潛在目標分佈學習,為建模連續序數空間提供了一種原則性解決方案。與強制確定性邊界劃分的傳統離散化不同,這種連續生成能力能夠實現軟語義過渡的動態學習,從而完美捕獲相鄰序數值之間的非平穩梯度。為此,我們正式提出了一種新範式——**連續生成序數回歸**,並引入了**DiffoR**,這是一個統一的基於擴散的框架,通過聯合生成而非離散分類來將序數目標建模為結構化的多變量連續分佈。不同於先前的範式,我們將OR重構為一個條件連續值恢復過程,通過迭代去噪逐步估計目標。為了在生成過程中注入序數先驗並明確保留序數拓撲,我們設計了**多尺度增量聚合**,將預測建模為*多變量連續分佈*。該機制將目標解耦為分層連續增量,從全局粗粒度估計延伸至局部細粒度細化。與獨立預測不同,我們的模型從共享的潛在表示中聯合生成所有組件,確保跨尺度的序數依賴性和全局一致性。通過將Transformer中的不同注意力頭分配給特定尺度的特徵編碼,我們利用並行注意力子空間捕獲多粒度序數依賴關係,實現高效的聯合解碼。  

此外,呼應從粗到細的認知感知(其中宏觀判斷如“老年人”依賴於低頻結構,微觀估計如“65歲”需要高頻細節),我們引入了**動態去噪感知**策略。認識到不同的序數增量對應不同的特徵頻率譜,我們摒棄了標準擴散模型的統一時間步長慣例。通過注入尺度自適應的隨機擾動來解耦去噪過程,使模型能夠在高噪聲水平下學習粗尺度魯棒表示,同時保留低噪聲步驟用於細粒度校準。這種動態同步有效地將去噪軌跡與目標的分層語義對齊。  

總體而言,本文的貢獻如下:  
- • 我們提供了嚴格的理論分析,揭示了現有範式固有的局限性,並提出了一種新範式,將序數回歸形式化為連續生成任務,以繞過量化限制。  
- • 我們開發了DiffoR,一個專為OR定制的統一連續回歸框架,該框架採用擴散生成來捕獲多樣的潛在序數空間。通過利用軟語義過渡,準確捕獲相鄰值之間的非平穩梯度。  
- • 我們設計了一種雙解耦策略,包括**多尺度增量聚合**以構建結構化序數空間,以及**動態去噪感知**以將語義粒度與特徵頻率對齊。理論分析證明了該設計顯著增強了模型的表示能力和可解釋性。  
- • 在橫跨四個領域的12個序數回歸基準上的大量實驗證明了DiffoR的強大泛化能力和相較於SOTAs的一致優越性。  

## 2. 相關工作  

### 2.1. 序數回歸(OR)  
OR處理具有有序目標的預測任務,廣泛應用於多種領域,如人臉年齡估計[128, 115]、圖像美學/質量評估[135, 81]、觀看時長預測[1, 8, 2, 7]、生命週期價值預測[96, 112, 124]。OR的研究格局已見證了從連續映射向離散建模的轉變。最初的**樸素回歸**方法[45]使用標準回歸損失,但難以處理非均勻的序數區間。**連續空間離散化(CSD)**[139, 44]和**基於排名的方法**[42, 1, 8]將回歸轉化為分類或二元子任務。儘管流行,它們仍遭受固有的量化偽影和剛性邊界劃分,導致全局序數空間碎片化。**離散生成模型**[111, 149]模仿LLMs生成序數序列,但仍受限於離散詞彙和啟發式分詞。而基於CLIP的方法[161, 164, 162, 163]通過視覺-語言對齊增強了語義理解,但並未解決離散化的根本限制。在本文中,我們的DiffoR是首個面向OR的連續生成框架,通過擴散將目標分佈建模為連續流形,能有效捕獲序數值之間的軟性非平穩過渡。  

### 2.2. 生成式回歸建模  
生成式建模傳統上分為離散和連續兩大範式。離散生成模型,以大型語言模型(LLMs)[104, 106, 107, 108, 109]為代表,通過自回歸令牌預測擅長捕獲序列依賴性。雖然最近被應用於序數回歸[111, 149],但這些方法本質上受啟發式詞彙和量化誤差限制,限制了精確估計。相反,連續生成模型,如擴散[129]和流匹配[29],因其在建模複雜高維概率密度流形方面的卓越能力而迅速崛起。利用這一能力,最近的工作已成功地將擴散模型擴展到標準分類[151]、物體檢測[126]等任務,並取得了顯著成果。

相似文章

对比顺序学习:一种通用的序数回归框架

arXiv cs.LG

ConOrd提出了一种用于序数回归的对比学习框架,融合了对比学习与顺序学习的优势,在人脸年龄估计、图像质量评估和视频质量评估任务中达到了最先进性能。

LangFlow:连续扩散在语言建模中可与离散扩散相媲美

Hugging Face Daily Papers

LangFlow提出了首个可与离散扩散方法相媲美的连续扩散语言模型,挑战了长期以来认为连续扩散在语言建模中劣于离散扩散的观点。该工作引入了基于最优Gumbel噪声调度等关键要素,并展示了与离散扩散基线相比具有竞争力的困惑度和迁移学习性能。