reasoning-failure

标签

Cards List
#reasoning-failure

信任却未验证:大型语言模型来源评估中的认知盲区

arXiv cs.LG · 2026-06-05 缓存

这篇论文识别了大型语言模型(LLM)中的一个失败模式:在综合多个来源时,模型不会验证数值统计的有效性,而是依赖分析严谨性的文体标记。作者将此称为“认知对齐”(epistemic alignment),并表明该现象在多个模型和领域中持续存在,且抵制基于提示的缓解措施。

0 人收藏 0 人点赞
#reasoning-failure

置信捷径:掩码扩散模型的一种推理失效模式

arXiv cs.AI · 2026-05-29 缓存

本文识别了掩码扩散语言模型中的一种失效模式:基于置信度的解码在复杂推理任务中导致高置信度错误,并表明置信对齐训练会加剧此问题,而随机掩码则能保持推理性能。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈