面向任务的合成数据生成以提升农业预测任务中的机器学习性能

arXiv cs.AI 论文

摘要

提出了一种任务条件化合成数据生成(TCSDG)算法,该算法结合了贝叶斯网络生成器与基于Transformer的表格基础模型,旨在提升农业预测任务中的机器学习性能,并在基准测试中表现出一致的改进。

arXiv:2607.09751v1 公告类型:新 摘要:机器学习(ML)算法已被广泛应用于不同背景下估算农业变量。然而,由于训练数据的数量和质量对ML算法的性能有强烈影响,其使用可能受限于有限或不完整的参考数据。合成数据生成(SDG)通过生成保留原始数据关键特征的人工但真实的样本,为解决这一问题提供了一种实用方法。基于表格数据的教师-学生知识迁移和上下文学习,本研究提出了一种任务条件化SDG(TCSDG)算法,该算法将贝叶斯网络生成器与基于Transformer的表格基础模型(TabICL)配对。该算法在两个农业预测任务上进行了评估:作物产量预测和作物类型分类。还使用了六种基准SDG算法来比较其与TCSDG的性能。在十二个研究站点、两个训练数据比例、四个倍增比例和三种预测性机器学习算法中,使用TCSDG生成的合成数据增强原始数据,在89%的作物类型分类实验和74%的作物产量预测实验中提升了ML性能。TCSDG也显著优于基准SDG算法,并且是唯一在总体层面上始终改进两项任务ML性能的方法。研究表明,精心设计和处理的合成数据可以提升精准农业应用中ML的性能。TCSDG为生成支持下游ML农业预测的合成数据提供了一个实用且可扩展的框架。TCSDG的完整实现已作为开源代码公开,地址为 https://github.com/HamidEbrahimy/TCSDG。
查看原文
查看缓存全文

缓存时间: 2026/07/14 04:17

# 任务条件化合成数据生成:提升机器学习在农业预测任务中的性能  
来源: https://arxiv.org/html/2607.09751  
Hamid Ebrahimy¹,²,\* Moritz Lucas¹,² Martin Atzmueller¹,³  
¹ 奥斯纳布吕克大学,人工智能与数据科学联合实验室,德国奥斯纳布吕克  
² 莱布尼茨农业工程与生物经济研究所 (ATB),德国波茨坦  
³ 德国人工智能研究中心 (DFKI),合作与自主系统研究部 (CAS),德国奥斯纳布吕克  
\* 通讯作者: hamid\.ebrahimy@uni\-osnabrueck\.de  

###### 摘要  
机器学习算法已广泛应用于跨不同情境的农业变量估计。然而,由于训练数据的数量和质量对机器学习算法性能影响显著,其应用常受限于参考数据的不足或不完整。合成数据生成通过生成保留原始数据关键特征的人工但逼真的样本,为解决此问题提供了实用方法。本研究基于师生知识迁移和表格数据的情境学习,提出了一种任务条件化合成数据生成算法,该算法将贝叶斯网络生成器与基于变换器的表格基础模型 (TabICL) 配对。该算法在两个农业预测任务(作物产量预测和作物类型分类)上进行了评估。同时使用了六种基准合成数据生成算法与 TCSDG 进行性能比较。在十二个研究地点、两种训练数据比例、四种倍增比率和三种预测机器学习算法下,使用 TCSDG 生成的合成数据增强原始数据在 89% 的作物类型分类实验和 74% 的作物产量预测实验中提升了机器学习性能。TCSDG 还显著优于基准合成数据生成算法,并且是在总体层面上唯一能在这两个任务中持续提升机器学习性能的方法。该研究表明,精心设计和处理的合成数据可以提升精准农业应用中机器学习算法的性能。TCSDG 提供了一个实用且可扩展的框架,用于生成支持下游机器学习农业预测的合成数据。TCSDG 的完整实现已作为开源代码在 https://github.com/HamidEbrahimy/TCSDG 公开提供。  

## 1 引言  
农业变量是关键的指标,已广泛应用于粮食安全评估、农业优化、经济规划和气候变化影响评估等多个领域。随着人口增长和气候变化对农业影响的加剧,对农业变量进行持续监测和评估至关重要,并且仍是实现长期农业可持续性和粮食安全的关键。因此,鉴于农业变量在广泛应用中的重要性,数据分析、遥感技术和机器学习算法的显著进展被用于其评估。  

机器学习算法被广泛用于预测不同的农业变量。这些算法能够处理大量异构数据,包括气象变量、土壤特性、作物健康指标和遥感数据。广义上,监督式机器学习模型采用先进的计算策略来分析特定农业自变量(如土壤湿度、气候条件、作物生长阶段)与特定农业因变量(如作物产量、作物类型)之间的关系。然后,这些模型将学习到的关系应用于缺乏直接测量的空间或时间背景下的农业变量预测。  

监督式机器学习算法本质上依赖于训练数据,因为它们从示例中学习模式、关系和表示,以建立输入与输出之间的功能映射。从统计学习的角度来看,更大的训练数据集有助于模型更准确地逼近底层数据分布,从而提高模型的性能及其在训练集之外的泛化能力。然而,必须注意,数据量本身并不能保证最优性能;输入机器学习算法的数据还必须具有高质量和代表性,以确保可靠的结果。因此,训练数据的数量和质量在很大程度上决定了特定算法在预测性能和鲁棒性方面的成功程度。  

尽管技术进步且需求迫切,农业参考数据的可用性仍然不足。数据质量、数量和时空覆盖方面的缺陷构成了重大障碍,可能阻碍最先进的预测性机器学习模型的发展。在许多实际农业应用中,可用的参考数据还存在测量不准确、记录不完整和代表性有限的问题。此外,数据收集方法和数据特征的不一致性阻碍了跨区域和长期比较研究,这主要是由于农业变量在不同区域之间存在显著差异,并且随着外部因素(如气候变化和农业系统演变)而变化。  

为了解决不同研究领域中参考数据不足相关的挑战,已经开发并应用了各种方法来弥补这些数据缺口。这些方法大致可分为两大类:以算法为中心的方法和以数据为中心的方法。以算法为中心的技术侧重于优化框架,通过元学习和概率建模等技术从不完整的参考数据中提取最大价值。另一方面,以数据为中心的方法侧重于通过数据增强、合成数据生成和来自多个来源的数据整合等技术来修改、扩展或优化参考数据。  

以数据为中心的方法,尤其是合成数据生成算法,除了提升机器学习模型的性能和泛化能力外,还通过直接解决参考数据的局限性而带来额外优势。它们通常旨在生成保持原始数据关键结构特征的合成数据,以补充不完整的数据,从而减少对昂贵、耗时或敏感的数据采集过程的依赖。该过程涉及应用数学和概率模型来复制原始数据的底层结构。合成数据生成算法能够创建逼真但合成的数据,可用于各种目的,包括但不限于模型训练-验证-测试和情景模拟。此外,这些算法通过提供生成保留原始数据统计属性且保护隐私的合成数据的机制,有助于保护敏感信息,促进数据共享并符合监管要求。  

近年来,多种合成数据生成算法已被引入并应用于多个领域。许多常用的合成数据生成方法围绕两个目标之一设计:特征空间中的局部插值或全局分布保真度;然而,这两个目标本身都不能保证生成的合成数据对下游学习任务有用。当合成样本在真实数据分布下合理、在已校准的预测模型下具有信息性、且相对于真实数据具有多样性或非冗余性时,它更可能对下游学习器有益。基于此,表格数据的合成数据生成可以被表述为一个监督式、任务条件化的问题,而不是一个无条件的模仿数据问题。核心假设是:有用的合成样本必须同时满足两个要求——它们在原始数据分布下应具有统计合理性,并且它们应保留下游分类器或回归器所需的特征-目标关系。  

为了操作化这一假设,并基于师生知识迁移和表格数据情境学习的理论基础,提出了一种任务条件化合成数据生成框架,该框架由贝叶斯网络候选生成器、作为任务感知评判者的基础模型教师以及保持覆盖的选择机制组成。任务条件化主要来源于教师引导的过滤、目标空间预算分配和保持覆盖的选择,而非仅由候选生成器单独提供。具体在框架内,贝叶斯网络算法生成一个大的候选合成样本池,然后由 TabICL(用于情境学习的表格基础模型)算法作为预测型教师评估这些候选样本,而不是仅基于生成似然或分布相似性接受它们。使用表格情境学习器作为教师的动机源于最近的证据,表明表格基础模型可以通过直接以标记示例为条件进行强大的监督式预测。此外,小批量 k-means 多样化步骤和结合经验先验与逆频率先验的凸预算分配方案确保了少数类别和条件获得比例性丰富的合成支持,而不会扭曲全局边际分布。  

本工作的贡献有三点。第一,本研究引入了 TCSDG,一个用于监督式表格学习的任务条件化流水线,它整合了目标空间预算分配、教师引导的一致性过滤、保持覆盖的选择以及质量感知的样本加权。第二,TCSDG 在相同的实验条件下与文献中主要方法论家族的六种既定表格合成数据生成方法(概率图、对抗、潜变量和扩散方法)进行基准比较,提供了一个受控的、以效用为先的比较。第三,该比较在十二个监督式农业预测任务上实例化:六个作物类型分类数据集和六个覆盖玉米和小麦的作物产量预测数据集,提供了在精准农业中表格合成数据生成效用的系统性多地点、多任务评估。多地点、多任务设计的动机源于数据驱动的农业模型对环境、土壤和气候变异性的已知敏感性。通过跨多个研究地点和设置进行实验,本研究旨在确保性能评估不仅限于特定地点,而是捕捉不同农业系统中固有的变异性,从而提高关于合成数据生成算法影响所得结论的可靠性和泛化性。  

## 2 材料与方法  
### 2.1 TCSDG(任务条件化合成数据生成)算法  
TCSDG 是一种用于监督式表格学习的任务条件化合成数据生成算法。图 1 总结了完整的 TCSDG 过程(伪代码)。给定一个真实训练集和用户指定的合成-真实比率 r > 0,TCSDG 产生合成记录,这些记录可用于替换原始训练数据和/或增强原始训练数据以用于下游监督式任务。该算法分为五个阶段:预算分配、教师训练与校准、候选生成、教师引导与保持覆盖的选择、以及样本加权。  

参见图 1 说明  
图 1: 用于表格合成数据生成的 TCSDG 算法伪代码。  

#### 2.1.1 预算分配  
预算分配的

相似文章

生成更好训练数据的智能体(25分钟阅读)

TLDR AI

Autodata 引入了一种智能体数据科学家,它能够迭代生成并优化合成训练数据,并通过元优化进一步提升数据质量,在计算机科学和法律推理任务上取得了更好的效果。

@neural_avb: https://x.com/neural_avb/status/2072294078805684613

X AI KOLs Timeline

本论文介绍了Autodata,这是一种利用智能“数据科学家”AI的方法,通过迭代生成、验证和优化来自动创建高质量合成数据集,该方法特别针对强化学习(GRPO)进行了优化,以提升语言模型的推理能力。

LLM引导的任务语义场分解用于工业过程预测

arXiv cs.LG

本文提出任务语义场分解(TSF),一种LLM引导的框架,利用过程文档的离线语义构建来增强工业过程中的时间序列预测和软测量。TSF在几乎不增加参数和推理开销的情况下,平均降低了6.4%的MAE。