ChiroEcho:超越已学习分类法的自动化蝙蝠发声分类扩展
摘要
ChiroEcho是一个深度学习框架,通过结合物种和属的预测与地理数据,扩展了自动化蝙蝠发声分类,将欧洲蝙蝠物种的操作覆盖率从73%提高到85%。
arXiv:2608.18191v1 公告类型:新
摘要:蝙蝠是生态系统健康的关键指标,在整个欧洲受到保护,因此可靠的种群监测是保护工作的优先事项。它们隐秘的夜行生活方式使得被动声学监测至关重要,但自动识别仍然困难,因为回声定位叫声随行为和环境变化,并在物种间重叠。我们提出一个深度学习框架,联合预测物种和属,并在推理阶段结合属的预测与物种地理分布。当预测属中只有一个物种出现在某个区域时,该框架可以解决不在所学分类法中的物种。这重新定义了地理信息作为一种扩展分类器有效分类法的手段,而不是限制它。使用涵盖35种欧洲蝙蝠物种的录音,我们评估闭集分类,检查稀有代表物种的性能估计不稳定性,并进行受控的留出验证原理实验。稀有物种分析显示了有限的评估数据如何模糊物种级别的性能,而留出实验表明属的预测和位置可以恢复物种头不可用的标签。地理分辨率将操作覆盖率从35种扩展到48种本土欧洲蝙蝠物种中的41种,覆盖率从73%提高到85%。据我们所知,这是自动化欧洲蝙蝠分类报告的最广泛操作覆盖率。更广泛地说,蝙蝠框架通过结合粗糙预测和透明外部约束,为解决未见过的细粒度类别提供了原理验证。
查看缓存全文
缓存时间: 2026/08/20 10:22
# ChiroEcho:将自动化蝙蝠发声分类扩展至学习分类体系之外
来源:https://arxiv.org/html/2608.18191
Welmoed Eversteijn https://orcid.org/0009-0003-0036-025X
附属机构:荷兰自然生物多样性中心
附属机构:蒂尔堡大学认知科学与人工智能系
Milan van Hirtum https://orcid.org/0009-0003-5962-9794
附属机构:荷兰自然生物多样性中心
Juan Sebastián Cañas https://orcid.org/0000-0003-0365-5005
附属机构:荷兰自然生物多样性中心
附属机构:伦敦大学学院人类与自然实验室
Vincent J\. Kalkman https://orcid.org/0000-0002-1484-7865
附属机构:荷兰自然生物多样性中心
Dan Stowell https://orcid.org/0000-0001-8068-3769
附属机构:荷兰自然生物多样性中心
附属机构:蒂尔堡大学认知科学与人工智能系
附属机构:莱顿大学高级计算机科学研究所
电子邮箱 [burooj\.ghani,leonie\.baier@naturalis\.nl](mailto:{burooj.ghani,leonie.baier}@naturalis.nl)
A\. Leonie Baier https://orcid.org/0000-0002-0327-0378
附属机构:荷兰自然生物多样性中心
###### 摘要
蝙蝠是生态系统健康的关键指示物种,在欧洲受到全面保护,因此可靠的人口监测成为保护工作的优先事项。其隐秘的夜行性生活方式使得被动声学监测至关重要,但由于回声定位信号会随行为和环境变化且物种间存在重叠,自动化识别仍然困难。我们提出一种深度学习框架,可同时预测物种和属,并在推理阶段将属的预测与地理物种分布相结合。当预测属在特定区域仅存在一个物种时,该框架能够识别学习分类体系中缺失的物种。这将地理信息重新构建为扩展而非限制分类器有效分类体系的手段。利用涵盖35种欧洲蝙蝠物种的录音,我们评估了闭集分类性能,检验了稀有物种表现估计的不稳定性,并进行了受控的留出验证实验。稀有物种分析表明有限的评估数据可能模糊物种层面的表现,而留出实验显示属的预测与地理位置可恢复物种层级头部无法提供的标签。地理分辨率将操作覆盖范围从48种欧洲原生蝙蝠中的35种扩展至41种,覆盖率从73%提升至85%。据我们所知,这是目前报道的欧洲蝙蝠自动化分类中最广泛的操作覆盖范围。更广泛而言,该蝙蝠框架为通过结合粗粒度预测与透明的外部约束来解析未见的细粒度类别提供了概念验证。
###### 关键词:
生物声学 深度学习 生物多样性监测 蝙蝠 生态学 生态推理 地理先验
## 1 引言
蝙蝠在生态系统中具有重要生态作用,却是欧洲生态系统中最不显眼的居民之一。它们夜行且隐秘的生活方式[17 (https://arxiv.org/html/2608.18191#bib.bib17)]常常掩盖了其在昆虫抑制、营养物质传输和营养级调节方面的作用[20 (https://arxiv.org/html/2608.18191#bib.bib20),55 (https://arxiv.org/html/2608.18191#bib.bib55),47 (https://arxiv.org/html/2608.18191#bib.bib47)]。许多欧洲蝙蝠种群也经历了长期数量下降[5 (https://arxiv.org/html/2608.18191#bib.bib5)],且欧洲蝙蝠受到欧盟《栖息地指令》的严格法律保护[14 (https://arxiv.org/html/2608.18191#bib.bib14)]。它们对环境变化的敏感性使其种群趋势成为广泛使用的生态系统健康指标[26 (https://arxiv.org/html/2608.18191#bib.bib26),44 (https://arxiv.org/html/2608.18191#bib.bib44),50 (https://arxiv.org/html/2608.18191#bib.bib50)],将可靠的长期监测置于生物多样性保护的核心地位[7 (https://arxiv.org/html/2608.18191#bib.bib7)]。
这些特性使得声学监测成为调查蝙蝠种群不可或缺的手段[43 (https://arxiv.org/html/2608.18191#bib.bib43)]。现代被动声学监测系统使用低成本自主检测器,在前所未有的空间和时间尺度上持续收集超声波录音[42 (https://arxiv.org/html/2608.18191#bib.bib42)]。然而,将这些录音转化为生态信息仍然具有挑战性[45 (https://arxiv.org/html/2608.18191#bib.bib45),46 (https://arxiv.org/html/2608.18191#bib.bib46),42 (https://arxiv.org/html/2608.18191#bib.bib42)]。与鸟类和许多其他类群常使用通信信号进行自动化识别不同,蝙蝠分类主要依赖回声定位信号,其结构不仅随物种身份变化,还受飞行行为、栖息地和觅食环境影响[11 (https://arxiv.org/html/2608.18191#bib.bib11)]。因此,回声定位信号在物种间存在重叠,在物种内也存在变化[16 (https://arxiv.org/html/2608.18191#bib.bib16)],使得即使是经验丰富的蝙蝠工作者也难以可靠识别[46 (https://arxiv.org/html/2608.18191#bib.bib46)]。
深度学习显著提升了自动化声学物种识别能力[52 (https://arxiv.org/html/2608.18191#bib.bib52),37 (https://arxiv.org/html/2608.18191#bib.bib37)]。然而,这一进展大多依赖于相对较小、经过整理的数据集,这些数据集适用于架构和训练策略的可控比较[4 (https://arxiv.org/html/2608.18191#bib.bib4),18 (https://arxiv.org/html/2608.18191#bib.bib18),1 (https://arxiv.org/html/2608.18191#bib.bib1)]。这种关注虽加速了方法学发展,但往往将分类学广度置于次要地位,限制了分类器在大陆尺度监测中的适用性。对于蝙蝠,更广泛的覆盖范围需要超越声学建模:专家在手工识别时常将声学证据与上下文生态知识相结合[43 (https://arxiv.org/html/2608.18191#bib.bib43)]。改进自动化蝙蝠分类不必仅依赖日益复杂的神经网络架构;在推理阶段整合生态信息为提升实际效用提供了互补路径。
为验证这一原理,我们提出一个具有物种和属层级分类头部的欧洲蝙蝠发声自动化分类框架。在推理阶段,每个属的预测与区域物种分布相结合;当录音位置仅存在该属的一个物种时,预测将明确解析为该物种(图1 (https://arxiv.org/html/2608.18191#S1.F1))。这使得识别地理上受限的分类单元成为可能,包括训练集中缺失的物种,从而扩展了框架的操作分类体系。据我们所知,这代表了生物声学分类中地理信息应用的新范式:它扩展了分类器的有效分类体系,而非将预测约束在固定体系内。更广泛而言,这种“明确时解析”的策略不仅限于声学数据或地理学:任何层级分类器均可通过结合可靠的粗粒度预测与外部领域知识(如季节性出现或生物关联)来唯一确定更细粒度的类别。因此,我们的蝙蝠框架为这一更广泛的推理策略提供了概念验证。
本工作的主要贡献有三:
1. 1\. 引入联合物种和属层级分类器,为下游生态推断提供明确的属层级预测。
2. 2\. 呈现迄今最广泛的欧洲蝙蝠发声分类器,将覆盖范围从35个训练物种扩展至48种欧洲原生蝙蝠中的41种111EUROBATS协定目前列有55种蝙蝠,其中48种出现在最新欧盟蝙蝠行动计划所涵盖的区域内[56 (https://arxiv.org/html/2608.18191#bib.bib56)]。详见表S1 (https://arxiv.org/html/2608.18191#Sx3.T1)。
3. 3\. 演示了一种“明确时解析”策略,其中地理先验将属层级预测转换为训练集中缺失分类单元的物种级识别,为通过外部领域知识扩展层级分类器提供了概念验证。
参见标题图1:以Plecotus kolombatovici为例说明推理阶段的地理分辨率。(a, c) 分别为P\. austriacus和P\. kolombatovici的回声定位信号序列。(b) P\. austriacus(橙色)和P\. kolombatovici(蓝色)的大致南欧分布范围,重叠区域以橙蓝色交叉线表示(范围基于Dietz等[13 (https://arxiv.org/html/2608.18191#bib.bib13)])。由于录音不足,P\. kolombatovici未被纳入学习分类体系。因此,物种头部可能将此类录音归类为声学相似的同属物种,此处以P\. austriacus为例。对于来自塞浦路斯的录音,超过置信阈值的属层级Plecotus预测会激活地理查询(表1 (https://arxiv.org/html/2608.18191#S3.T1)),由于该属在该区域仅有P\. kolombatovici这一代表,因此将录音解析为该物种。
## 2 相关工作
### 2\.1 自动化生物声学分类
自动化生物声学分类已从基于手工声学特征的流程快速转向深度学习方法,最常见的是处理时频表示(如频谱图)[23 (https://arxiv.org/html/2608.18191#bib.bib23),27 (https://arxiv.org/html/2608.18191#bib.bib27),52 (https://arxiv.org/html/2608.18191#bib.bib52),49 (https://arxiv.org/html/2608.18191#bib.bib49)]。卷积和Transformer架构现已能跨多样类群和录音条件进行大规模分析[53 (https://arxiv.org/html/2608.18191#bib.bib53),27 (https://arxiv.org/html/2608.18191#bib.bib27),24 (https://arxiv.org/html/2608.18191#bib.bib24),6 (https://arxiv.org/html/2608.18191#bib.bib6),38 (https://arxiv.org/html/2608.18191#bib.bib38)]。基于此,从大型音频库进行迁移学习已成为提升低资源场景性能的关键策略[15 (https://arxiv.org/html/2608.18191#bib.bib15),33 (https://arxiv.org/html/2608.18191#bib.bib33),21 (https://arxiv.org/html/2608.18191#bib.bib21)],使模型能在有限标注数据下跨领域和类群泛化[40 (https://arxiv.org/html/2608.18191#bib.bib40),22 (https://arxiv.org/html/2608.18191#bib.bib22),30 (https://arxiv.org/html/2608.18191#bib.bib30),25 (https://arxiv.org/html/2608.18191#bib.bib25)]。尽管有这些进展,大多数现有系统本质上仍是闭集的,将预测限制在训练期间确定的预定义分类体系内[52 (https://arxiv.org/html/2608.18191#bib.bib52),28 (https://arxiv.org/html/2608.18191#bib.bib28)]。这一假设限制了其在现实监测中的适用性,因为可能出现新颖或先前未见的物种,这促使近期对能够更好处理分类不确定性和扩展性的开放集和开放世界生物声学分类框架产生了兴趣[9 (https://arxiv.org/html/2608.18191#bib.bib9),39 (https://arxiv.org/html/2608.18191#bib.bib39),32 (https://arxiv.org/html/2608.18191#bib.bib32),29 (https://arxiv.org/html/2608.18191#bib.bib29)]。
### 2\.2 自动化蝙蝠发声分类
蝙蝠相关研究同样表明,基于频谱图的卷积网络优于手工声学描述符[59 (https://arxiv.org/html/2608.18191#bib.bib59),8 (https://arxiv.org/html/2608.18191#bib.bib8),48 (https://arxiv.org/html/2608.18191#bib.bib48)]。后续工作解决了联合检测与分类[36 (https://arxiv.org/html/2608.18191#bib.bib36)]、Transformer架构[4 (https://arxiv.org/html/2608.18191#bib.bib4),18 (https://arxiv.org/html/2608.18191#bib.bib18)]、多标签预测[12 (https://arxiv.org/html/2608.18191#bib.bib12)]和行为标注[58 (https://arxiv.org/html/2608.18191#bib.bib58)]等问题。包括NABat ML[31 (https://arxiv.org/html/2608.18191#bib.bib31)]、BatDetect2[36 (https://arxiv.org/html/2608.18191#bib.bib36)]、BatSpot[51 (https://arxiv.org/html/2608.18191#bib.bib51)]和BSG-BATS[37 (https://arxiv.org/html/2608.18191#bib.bib37)]在内的开源框架日益强调可重复部署和社区驱动的被动声学监测开发。尽管有这些进展,蝙蝠分类器仍受限于稀缺且异质的标注。公共存储库通常呈长尾分布,结合了不同的录音设备和协议,并提供弱录音级标签而非强标注的、时间局部化的叫声[8 (https://arxiv.org/html/2608.18191#bib.bib8)]。社区倡议扩大了录音和标注工具的使用范围[37 (https://arxiv.org/html/2608.18191#bib.bib37)],而数据增强和迁移学习可以在有限监督下改善泛化能力[18 (https://arxiv.org/html/2608.18191#bib.bib18),22 (https://arxiv.org/html/2608.18191#bib.bib22)]。尽管如此,具有代表性的训练数据仍是实现广泛分类学覆盖的主要瓶颈。
### 2\.3 自动化分类中的生态知识
生态知识在自动化蝙蝠分类中仍利用不足。在生物声学和细粒度视觉物种分类中,地理先验主要将预测约束在固定分类体系内的本地可能物种[27 (https://arxiv.org/html/2608.18191#bib.bib27),35 (https://arxiv.org/html/2608.18191#bib.bib35)]。我们则利用地理信息扩展有效分类体系,当属和位置唯一确定物种身份时,解析训练集中缺失的地理受限物种。据我们所知,这种重构在此前两个领域中都未被探索。
## 3 方法学
### 3\.1 数据集
我们使用ChirosetEurope222ChirosetEurope: https://doi.org/10.5281/zenodo.20773226[2 (https://arxiv.org/html/2608.18191#bib.bib2)]训练和评估分类器,这是一个整理过的欧洲蝙蝠发声(回声定位和社交叫声)集合。该数据集包含来自西古北界32个国家的35种欧洲蝙蝠物种的11,517条录音(表S2 (https://arxiv.org/html/2608.18191#Sx3.T2))。正如预期,作为一个机会性汇编的生物声学数据集,录音呈长尾分布:广泛分布的分类单元比地理受限物种得到更好的呈现(图S1 (https://arxiv.org/html/2608.18191#Sx3.F1))。我们保留这种自然不平衡以反映实际操作中的被动声学监测条件。ChirosetEurope包括本地的全频谱超声波和历史时间扩展录音;元数据记录了每条录音的时间扩展因子(TEF),以便在预处理期间转换为共同表示。它提供录音级(弱)物种标签而非时间局部化的叫声标注;因此,提出的模型采用弱监督进行训练。详见补充材料 (https://arxiv.org/html/2608.18191#Sx3)。
### 3\.2 音频预处理
所有录音在特征提取前转换为共同的输入表示。每条录音以其原始采样率加载,除非已是TEF = 10,否则进行十倍时间扩展,并重采样至3232 kHz。短于2020秒的录音被平铺至2020秒;较长的录音被分割为不重叠的2020秒段。长度至少为22秒的尾部余数被平铺至2020秒;较短的余数则被丢弃。相似文章
Echoverse:大规模训练计算机使用代理的深度演进环境
Echoverse 提出了一种生成深度、演进式合成环境的方法,用于训练计算机使用代理,展示了显著的准确率提升,并发布了一个包含有依据评分器的基准。
ECHO: 终端代理免费学习世界模型
ECHO引入了一种混合目标,将策略梯度损失与环境观测预测相结合,从终端反馈中提供密集监督,使Qwen3模型在TerminalBench-2.0上的性能翻倍。
jdopensource/JoyAI-Echo
京东开源发布了JoyAI-Echo(Echo-LongVideo),这是一个文本到音视频扩散模型,能够生成分钟级的多镜头视频,保持角色身份和声音一致,并利用DMD蒸馏实现了7.5倍的速度提升。
面向社交机器人中话轮切换的多模态语音活动预测:基于语音活动相关预训练编码器
提出了一种多模态语音活动预测框架,将仅音频的VAP扩展至视听输入,用于社交机器人的话轮切换预测,采用预训练骨干网络和低秩适应方法。在NoXi和Haru EDR语料库上取得了改进。
EchoChain:面向中断场景的全双工状态更新推理基准
EchoChain 是一项全新基准测试,旨在评估 AI 模型在用户中途打断时修正正在进行中的回复的能力。该基准提炼出三种典型故障模式(上下文惯性、中断遗忘、目标偏移),结果表明,在当前评估的实时语音模型中,无一系统的通过率突破 50%。