out-of-distribution

标签

Cards List
#out-of-distribution

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

arXiv cs.CL · 昨天 缓存

This paper presents EVIL-Detect, a multi-signal ensemble framework with conflict-aware fusion for detecting LLM-generated, refined, and human-written Chinese text in the NLPCC 2026 Shared Task 6, achieving first place with a macro-F1 of 0.8888.

0 人收藏 0 人点赞
#out-of-distribution

亚型鲁棒性不仅仅是准确性:未见亚型偏移下的校准

arXiv cs.LG · 2026-08-04 缓存

本文首次系统性地研究了未见亚型偏移下的校准问题,表明模型在已知粗粒度类别内的新亚型上会变得过度自信,并主张亚型鲁棒性应通过校准指标而非仅凭准确性来评估。

0 人收藏 0 人点赞
#out-of-distribution

PAN 2026的DACTYL团队:贝叶斯数据混合与经验X风险最小化在AI文本检测中的应用

arXiv cs.CL · 2026-07-21 缓存

本文介绍了使用贝叶斯数据混合和经验X风险最小化检测AI生成文本的方法,通过ModernBERT-large和MCGrad分类器在OOD检测上取得了高性能。

0 人收藏 0 人点赞
#out-of-distribution

论视觉推理中的局部性与长度泛化

Hugging Face Daily Papers · 2026-07-10 缓存

本文表明,最先进的视觉-语言模型在视觉推理中的长度泛化任务上因“全局捷径”而失败,并证明将局部中央凹感知与递归相结合能够实现鲁棒的分布外泛化。

0 人收藏 0 人点赞
#out-of-distribution

基于嵌套与层次重复的文本距离:一种压缩视角

arXiv cs.CL · 2026-07-08 缓存

本文提出了一种新的结构序列分析方法,采用Ladderpath方法提取嵌套和层次重复结构,定义了三种距离度量,在分布外和少样本文本分类任务中优于基于gzip的NCD和BERT,提供了一种轻量级、可解释的替代方案。

0 人收藏 0 人点赞
#out-of-distribution

动态Ising模型中的分布外神经推断

arXiv cs.LG · 2026-07-07 缓存

本文研究了用于重构动态Ising模型相互作用图的分布外神经推断,发现基于Transformer和卷积的模型展现出依赖于架构的统计先验,这些先验可能导致误导性的分布外鲁棒性。

0 人收藏 0 人点赞
#out-of-distribution

语言模型中风险规避的分布外泛化

arXiv cs.LG · 2026-07-07 缓存

本文介绍了RiskAverseOOD,一个用于衡量在低风险赌注中习得的风险规避行为如何泛化到语言模型中天文级别高风险赌注的基准。初步结果表明,像Qwen3-8B这样的模型能够部分地将风险规避泛化跨越98个数量级,但尚不足以可靠地作为安全故障保险。

0 人收藏 0 人点赞
#out-of-distribution

理解边缘:稀疏自编码器追踪Transformer泛化的界限

arXiv cs.LG · 2026-06-26 缓存

本文提出使用稀疏自编码器检测Transformer的分布外输入,包括拼写错误和越狱提示,通过分析虚假概念激活。该方法实现了一种基于机制的微调策略,以提高LLM的鲁棒性。

0 人收藏 0 人点赞
#out-of-distribution

灾难性组合生成:为什么基础扩散模型无法外推

arXiv cs.LG · 2026-06-24 缓存

本文认为,当目标分布处于分布外时,基础条件扩散模型在组合生成方面根本失败,原因是分数估计误差,并且推理时的校正无法完全补偿。

0 人收藏 0 人点赞
#out-of-distribution

Robusto-2:在利马和纽约市对人与VLMs进行自动驾驶基准测试

Hugging Face Daily Papers · 2026-06-18 缓存

本文研究了自动驾驶系统与人类在不同地理位置(利马和纽约市)的视觉问答任务中的表现,发现人类和VLM无论地点如何都表现出相似的性能,但根据问题类型存在差异。

0 人收藏 0 人点赞
#out-of-distribution

超越静态排行榜:LLM智能体评估的预测有效性

Hugging Face Daily Papers · 2026-06-18 缓存

本文认为,针对LLM智能体基准测试的聚合得分排行榜未能捕捉到与部署相关的维度,并且表现出排名不稳定性。文章提出根据预测有效性(即样本内排名与样本外排名之间的相关性)来对配置进行排序,并引入了一个十二层级的测量体系以及可证伪的分布外准则。

0 人收藏 0 人点赞
#out-of-distribution

无中生有:语言模型能否发现零?

arXiv cs.AI · 2026-06-17 缓存

本文探讨了语言模型能否独立发现零的概念,作为分布外泛化的一种形式。研究发现,GPT-2大小的模型在测试时无法做到,但通过零的示例训练后会有显著提升,并且语言预训练减少了所需示例的数量。

0 人收藏 0 人点赞
#out-of-distribution

基于多视图高斯过程的非参数机器文本检测

arXiv cs.LG · 2026-06-15 缓存

本文提出了一种非参数多视图高斯过程框架,用于检测机器生成的文本,该框架对诸如释义等对抗性操作具有鲁棒性。通过结合互补特征并提供校准的不确定性,它在保留攻击上优于现有检测器。

0 人收藏 0 人点赞
#out-of-distribution

ADAPTOOD:面向分布外心电图时间序列模型的不确定性感知微调

arXiv cs.LG · 2026-06-04 缓存

ADAPTOOD 是一种新颖框架,利用数据不确定性量化分布偏移的严重程度,并指导心电图时间序列模型在分布外设置下的微调。它将不确定性估计与低秩模型更新和自适应超参数优化相结合,在现有OOD自适应方法基础上实现了高达7%的准确率提升和12.9%的精确度提升。

0 人收藏 0 人点赞
#out-of-distribution

智胜变色龙:直播风险评估中战术性分布外偏移的反事实解耦

arXiv cs.LG · 2026-06-03 缓存

提出潜在预测反事实解耦(LPCD),通过在潜在层面将稳定的恶意意图与不断演变的叙述策略解耦,解决直播风险评估中的战术性分布外偏移,在大规模工业数据集上取得优越性能。

0 人收藏 0 人点赞
#out-of-distribution

面向鲁棒的上下文学习:利用分布外代理进行目标不可访问的示例检索

arXiv cs.CL · 2026-06-02 缓存

本文介绍了DOPA,一种演示搜索框架,该框架在目标领域不可访问时,利用分布外代理为大语言模型检索鲁棒的演示,从而增强在分布偏移下的上下文学习性能。

0 人收藏 0 人点赞
#out-of-distribution

面向安全对齐的课程学习

arXiv cs.LG · 2026-05-27 缓存

本文提出Staged-Competence,一种基于课程学习的DPO安全对齐框架,它按难度组织偏好数据,显著提升鲁棒性和数据效率,同时保持通用能力。

0 人收藏 0 人点赞
#out-of-distribution

生成式OOD正则化的基于模型的策略优化

arXiv cs.LG · 2026-05-26 缓存

介绍 GORMPO,一种密度正则化的离线强化学习算法,使用生成式密度建模将策略更新限制在高密度区域,在真实世界医疗数据集上实现17%的提升,并超越最先进的基线模型。

0 人收藏 0 人点赞
#out-of-distribution

更小的抽象状态空间实现强化学习中的跨尺度泛化

arXiv cs.LG · 2026-05-21 缓存

本文提出了强化学习中分布外泛化的首个理论模型,表明更小的抽象状态空间能够在POMDP中实现跨尺度泛化。

0 人收藏 0 人点赞
#out-of-distribution

用于领域泛化数据集蒸馏的频谱梯度手术

arXiv cs.LG · 2026-05-20

本文引入了领域泛化数据集蒸馏(DGDD),这是一个新的问题设定,旨在实现蒸馏数据集的分布外泛化,并提出了频谱梯度手术(SGS),通过利用频谱域中的跨域梯度一致性来解耦类判别信息和领域特定信息。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈