现代深度学习的不确定性估计与泛化界限

arXiv cs.LG 论文

摘要

本文提出了现代深度学习模型不确定性估计与泛化的理论界限。

arXiv:2606.13818v1 公告类型:新 摘要:本论文研究贝叶斯原理如何加深我们对现代深度学习系统的理解。尽管神经网络在预测性能上表现卓越,但其泛化能力和不确定性量化能力仍仅被部分理解。本论文从方法论和理论两个角度来应对这一挑战:将贝叶斯推断、函数空间建模和大偏差理论统一在一个共同的概率视角下。 在方法论方面,本论文引入了深度变分隐式过程(DVIP),这是一个可扩展的贝叶斯框架,将隐式过程扩展到深层架构。作为补充,提出了两种事后方法——变分线性化拉普拉斯近似(VaLLA)和固定均值高斯过程(FMGP)——为预训练的确定性网络配备校准后的不确定性估计。 理论贡献聚焦于现代机器学习中一个核心的开放问题:为什么大型过参数化神经网络泛化得这么好?为了解决这个问题,本论文开发了一个统一的概率框架,将三个关键机制——多样性、平滑性和随机性——通过PAC-Bayesian和大偏差理论的语言联系起来。
查看原文
查看缓存全文

缓存时间: 2026/06/15 09:08

# 现代深度学习的不确定性估计与泛化边界
来源:https://arxiv.org/abs/2606.13818
书目工具

## 书目与引用工具

书目浏览器 切换

代码、数据、媒体

## 与本文相关的代码、数据和媒体

演示

## 演示

相关论文

## 推荐与搜索工具

IArxiv推荐工具 切换

关于arXivLabs

## arXivLabs:与社区合作者的实验项目

arXivLabs 是一个框架,允许合作者直接在我们的网站上开发和共享新的 arXiv 功能。

使用 arXivLabs 的个人和组织都已接受并认同我们关于开放性、社区精神、卓越性和用户数据隐私的价值观。arXiv 致力于这些价值观,仅与遵守这些价值观的伙伴合作。

有一个能够为 arXiv 社区增添价值的项目想法?**了解更多关于 arXivLabs** (https://info.arxiv.org/labs/index.html)。

相似文章

教导模型用语言表达其不确定性

OpenAI Blog

OpenAI研究人员展示了GPT-3可以学会用自然语言表达关于其答案的标定不确定性,而无需使用模型logits。他们引入了CalibratedMath基准套件来评估这种能力。这种方法在分布漂移下表现出强劲的泛化能力,代表了模型首次表达关于其自身预测的良好标定口头不确定性的证据。