counterfactual

标签

Cards List
#counterfactual

CounterRoute:基于层次化反事实信用分配的自路由推理

arXiv cs.AI ↗ · 4天前 缓存

CounterRoute 引入了一个在线强化学习框架,该框架在双模式语言模型中联合学习路由和模式条件响应,从而提高准确性并减少推理令牌。

0 人收藏 0 人点赞
#counterfactual

C$^{3}$T: 社交媒体对话树中情感变化的反事实因果推理

arXiv cs.CL ↗ · 2026-09-03 缓存

本文提出了C3T,一个线程结构的时序模型,用于使用反事实因果推理预测社交媒体对话树中的情感变化,并介绍了用于因果情感推理的CaSiRe数据集。

0 人收藏 0 人点赞
#counterfactual

Decomposition of Evidence, Contradiction, and Fragility in Perturbation Responses

arXiv cs.AI ↗ · 2026-08-14 缓存

Introduces DECAF, a method that decomposes perturbation responses into evidence, contradiction, and fragility components, improving interpretability over raw response magnitude and achieving strong results across vision benchmarks.

0 人收藏 0 人点赞
#counterfactual

面向异构知识的LLM反事实基准测试与训练:实现事实一致性和顺序稳健的接地推理

arXiv cs.AI ↗ · 2026-08-11 缓存

本文介绍了TKFQA,一个包含10,130个基于表格、文本和知识图谱的问答对的反事实基准,用于评估LLM的事实一致性和顺序稳健推理,并提出了ORLF,一种训练框架,可提高推理链准确性并降低对输入顺序的敏感性。

0 人收藏 0 人点赞
#counterfactual

Evidence-RL:迈向证据密集型视觉推理

Hugging Face Daily Papers ↗ · 2026-08-08 缓存

本文介绍了反事实证据解耦(CED),这是一种训练时方法,使视觉语言模型依赖具体的图像证据而非语言先验或捷径,从而提升跨基准的视觉推理grounding能力。

0 人收藏 0 人点赞
#counterfactual

C$^3$PO: 评估全模态模型中的跨模态组合与反事实表现

arXiv cs.AI ↗ · 2026-08-07 缓存

介绍了C$^3$PO,一个包含3,404个样本的基准测试,用于评估多模态LLM中的跨模态组合与反事实推理。研究发现模态主导性导致了大多数失败,即使最佳模型(Gemini-3.1-Pro)也远低于人类准确率。

0 人收藏 0 人点赞
#counterfactual

CARGO-VL:面向视觉-语言模型的反事实仲裁与风险约束组优化

arXiv cs.AI ↗ · 2026-08-06 缓存

介绍了CARGO-VL,一种面向视觉-语言模型的组相对优化框架,通过反事实一致性和风险约束控制,改进对冲突图像-文本证据的处理以及不支持答案的回避,并提供了XMC冲突训练资源。

0 人收藏 0 人点赞
#counterfactual

DoTime: A Synthetic Benchmark Generator for Interventional and Counterfactual Time Series

arXiv cs.LG ↗ · 2026-07-31 缓存

DoTime is a synthetic benchmark generator for interventional and counterfactual time series, providing scalable TSCM-based data generation with exact ground truth, released as a PyPI package with evaluation suites. It enables training and benchmarking causal foundation models on non-observational time series data.

0 人收藏 0 人点赞
#counterfactual

VAD:多模态在线策略蒸馏中用于目标重建的视觉证据归因

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

介绍了视觉归因蒸馏(VAD),这是一种用于多模态在线策略蒸馏的反事实目标重建方法,可估计教师纠正中可归因于视觉的部分。在4B和9B规模下的细粒度视觉基准测试中,该方法优于现有方法。

0 人收藏 0 人点赞
#counterfactual

并非所有Token都值得同等信用:面向长CoT推理的反事实敏感性信用再分配

Hugging Face Daily Papers ↗ · 2026-07-30 缓存

本文提出反事实敏感性信用再分配(CSCR),这是GRPO的一种简单扩展,可降低高敏感性Token的信用,并重新归一化Token级优势,用于长CoT数学推理。它持续优于GRPO基线,同时揭示特权Token移位方向不可靠,主要反映反事实敏感性而非学习价值。

0 人收藏 0 人点赞
#counterfactual

TokenMem: 面向冻结大语言模型的忠实知识注入

arXiv cs.AI ↗ · 2026-07-28 缓存

TokenMem通过专用的交叉注意力通道向冻结的大语言模型注入知识,训练一个轻量的门控适配器(两阶段课程),以提升在反事实知识下的知识合规性,在反事实基准上实现了69-70%的知识合规率(KC),而传统RAG仅为20-52%。

0 人收藏 0 人点赞
#counterfactual

基于概念的扩散模型反事实视觉解释

arXiv cs.AI ↗ · 2026-07-28 缓存

介绍C-VCE,这是一种扩散框架,它在生成模型中内置了一个可解释的概念瓶颈层,从而无需依赖外部噪声鲁棒分类器即可实现人类引导的视觉反事实解释。

0 人收藏 0 人点赞
#counterfactual

抵制与更新:用于激励兼容LLM的反事实报告坐标

arXiv cs.AI ↗ · 2026-07-15 缓存

本文介绍了一种方法,通过使用反事实报告坐标来确保LLM报告其真实信念,这些坐标能够抵御压力,同时保持对真实证据的响应。该方法在基准测试上取得了高性能,证明了内部激励兼容的因果证书。

0 人收藏 0 人点赞
#counterfactual

用于回归的反事实残差数据增强

arXiv cs.LG ↗ · 2026-06-30 缓存

提出了一种针对表格回归的反事实残差数据增强(CRDA)方法,利用特征扰动下残差不变性生成逼真的训练样本,在基准测试中实现了显著的均方误差(MSE)降低。

0 人收藏 0 人点赞
#counterfactual

棒球投球序列的反事实优化及其对赛季级统计指标影响的估计

arXiv cs.LG ↗ · 2026-06-17 缓存

本文利用基于Transformer的模型对MLB Statcast数据进行反事实优化,发现同时优化最终投球和准备投球可以使K/9等赛季级统计指标提高超过1.0。

0 人收藏 0 人点赞
#counterfactual

良好解释的定义与解释LLM输出的挑战

arXiv cs.AI ↗ · 2026-06-16 缓存

本文基于反事实和先验信念提出了良好解释的定义,并探讨了在此定义下解释LLM输出固有的困难。

0 人收藏 0 人点赞
#counterfactual

WorldKernel: 世界模型是可行可能世界的耦合核

arXiv cs.AI ↗ · 2026-06-10 缓存

本文识别了一种故障模式,其中预测器在未识别的反事实耦合上坍缩为一点,并提出了一个使用正半定耦合核来约束反事实的框架,表明预测无法表示跨世界耦合的不确定性,且施加核约束可产生可处理的边界。

0 人收藏 0 人点赞
#counterfactual

决策感知记忆卡:面向工具使用LLM代理的反事实启发式上下文选择与压缩

arXiv cs.AI ↗ · 2026-06-09 缓存

介绍了CICL,一种决策感知上下文层,通过将上下文视为决策时刻的干预,使用反事实启发式评分和类型化记忆卡(受令牌预算限制),为工具使用的LLM代理选择和压缩证据。在SWE-bench和RepoBench上的实验显示,在检索准确性和行动关键性方面取得了实际提升。

0 人收藏 0 人点赞
#counterfactual

反事实评估揭示临床大语言模型和智能体的隐藏能力画像

arXiv cs.LG ↗ · 2026-06-01 缓存

本文介绍了因果敏感性得分(CSS),一种干预性指标,用于评估临床大语言模型和智能体在患者输入沿临床意义维度变化时,是否适当地更新其建议。该指标揭示了标准覆盖度指标未能捕捉的隐藏能力画像,暴露了安全盲点和结构性响应能力缺陷。

0 人收藏 0 人点赞
#counterfactual

COFT:面向大型语言模型公平思维链推理的反事实-共形解码

arXiv cs.CL ↗ · 2026-06-01 缓存

COFT是一种无需训练的解码方法,通过应用令牌级公平控制和共形校准来减少大型语言模型思维链推理中的偏见,以最小的计算开销实现30-55%的偏见降低。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈