out-of-distribution

标签

Cards List
#out-of-distribution

Show HN: Jevstiller – 蒸馏Jev为本地模型,设定不一致界限

Hacker News Top ↗ · 昨天 缓存

Jevstiller 是一款工具,能将大型AI模型蒸馏为本地模型,并设定可配置的不一致界限,以此加速推理,同时保证在指定比例的请求上与原模型保持一致。

0 人收藏 0 人点赞
#out-of-distribution

预训练模型在新型AI辅助教育问题教学评估中的应用评估

arXiv cs.AI ↗ · 6天前 缓存

本文评估了预训练模型用于AI辅助教育问题的教学评估,发现大语言模型优于传统模型,且战略性增强可提升分布外性能。

0 人收藏 0 人点赞
#out-of-distribution

MCR²在分布外泛化中的局限性

arXiv cs.LG ↗ · 2026-09-21 缓存

本文指出了MCR²在分布外泛化方面的两个局限性,表明其在分布漂移下可能会失效,并且纳入不变性原则并不能消除这种失效。

0 人收藏 0 人点赞
#out-of-distribution

AURA:用于电子邮件威胁检测的自适应不确定性路由分析

arXiv cs.LG ↗ · 2026-09-18 缓存

本文介绍AURA,一个多模态电子邮件威胁检测系统,它使用自适应不确定性路由来分析电子邮件内容和URL,实现对演变的对抗攻击的鲁棒泛化。

0 人收藏 0 人点赞
#out-of-distribution

警惕差距:PII检测系统中的鲁棒性风险

arXiv cs.LG ↗ · 2026-09-04 缓存

本文评估了在分布变化下PII检测系统的鲁棒性,识别了不同架构中的故障模式,并提出了一种混合检测管道,通过问答驱动的反馈循环来增强隐私保护。

0 人收藏 0 人点赞
#out-of-distribution

C-Score:开放世界无标签污染下半监督学习的鲁棒性评估超越准确性

arXiv cs.LG ↗ · 2026-08-24 缓存

本文介绍了C-Score,一个用于评估在开放世界无标签污染下的伪标签半监督学习的诊断框架,表明干净准确性不足以检测隐藏的性能退化。

0 人收藏 0 人点赞
#out-of-distribution

面向开放世界测试时适应的可靠神经坍缩近似方法

arXiv cs.LG ↗ · 2026-08-21 缓存

本文提出了一种名为ReNC的开放世界测试时适应方法,该方法利用神经坍缩作为结构先验来过滤分布外样本并优化原型,以实现可靠的模型适应。

0 人收藏 0 人点赞
#out-of-distribution

立场:神经约束推理中的经认证正确性需要符号集成

arXiv cs.AI ↗ · 2026-08-18 缓存

本文立场论文主张,对于约束满足问题的神经求解器,必须优先考虑符号集成以确保可证明的正确性,特别是在分布偏移下,并以数独为例。

0 人收藏 0 人点赞
#out-of-distribution

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper presents EVIL-Detect, a multi-signal ensemble framework with conflict-aware fusion for detecting LLM-generated, refined, and human-written Chinese text in the NLPCC 2026 Shared Task 6, achieving first place with a macro-F1 of 0.8888.

0 人收藏 0 人点赞
#out-of-distribution

亚型鲁棒性不仅仅是准确性:未见亚型偏移下的校准

arXiv cs.LG ↗ · 2026-08-04 缓存

本文首次系统性地研究了未见亚型偏移下的校准问题,表明模型在已知粗粒度类别内的新亚型上会变得过度自信,并主张亚型鲁棒性应通过校准指标而非仅凭准确性来评估。

0 人收藏 0 人点赞
#out-of-distribution

PAN 2026的DACTYL团队:贝叶斯数据混合与经验X风险最小化在AI文本检测中的应用

arXiv cs.CL ↗ · 2026-07-21 缓存

本文介绍了使用贝叶斯数据混合和经验X风险最小化检测AI生成文本的方法,通过ModernBERT-large和MCGrad分类器在OOD检测上取得了高性能。

0 人收藏 0 人点赞
#out-of-distribution

论视觉推理中的局部性与长度泛化

Hugging Face Daily Papers ↗ · 2026-07-10 缓存

本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。

0 人收藏 0 人点赞
#out-of-distribution

基于嵌套与层次重复的文本距离:一种压缩视角

arXiv cs.CL ↗ · 2026-07-08 缓存

本文提出了一种新的结构序列分析方法,采用Ladderpath方法提取嵌套和层次重复结构,定义了三种距离度量,在分布外和少样本文本分类任务中优于基于gzip的NCD和BERT,提供了一种轻量级、可解释的替代方案。

0 人收藏 0 人点赞
#out-of-distribution

动态Ising模型中的分布外神经推断

arXiv cs.LG ↗ · 2026-07-07 缓存

本文研究了用于重构动态Ising模型相互作用图的分布外神经推断,发现基于Transformer和卷积的模型展现出依赖于架构的统计先验,这些先验可能导致误导性的分布外鲁棒性。

0 人收藏 0 人点赞
#out-of-distribution

语言模型中风险规避的分布外泛化

arXiv cs.LG ↗ · 2026-07-07 缓存

本文介绍了RiskAverseOOD,一个用于衡量在低风险赌注中习得的风险规避行为如何泛化到语言模型中天文级别高风险赌注的基准。初步结果表明,像Qwen3-8B这样的模型能够部分地将风险规避泛化跨越98个数量级,但尚不足以可靠地作为安全故障保险。

0 人收藏 0 人点赞
#out-of-distribution

理解边缘:稀疏自编码器追踪Transformer泛化的界限

arXiv cs.LG ↗ · 2026-06-26 缓存

本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。

0 人收藏 0 人点赞
#out-of-distribution

灾难性组合生成:为什么基础扩散模型无法外推

arXiv cs.LG ↗ · 2026-06-24 缓存

本文认为,当目标分布处于分布外时,基础条件扩散模型在组合生成方面根本失败,原因是分数估计误差,并且推理时的校正无法完全补偿。

0 人收藏 0 人点赞
#out-of-distribution

Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。

0 人收藏 0 人点赞
#out-of-distribution

超越静态排行榜:LLM智能体评估的预测有效性

Hugging Face Daily Papers ↗ · 2026-06-18 缓存

本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。

0 人收藏 0 人点赞
#out-of-distribution

无中生有:语言模型能否发现零?

arXiv cs.AI ↗ · 2026-06-17 缓存

本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈