标签
本文研究指令微调如何影响问答任务中的模型置信度与词汇多样性,发现指令微调会改变置信度并降低推理多样性,但并未改善校准性能。
一项针对无审查大模型(Gemma和Qwen)的研究表明,去除审查会使其在股市预测中更加乐观,但不会更准确。效果因模型家族而异。
DeepLook是一个无需训练的框架,通过在不确定性瓶颈处分配计算来提升LLM的推理能力,平均减少87.3%的token生成,同时提高竞赛数学基准的准确性。
提出双置信对比解码(DCCD),一种无需训练的检索增强生成方法,通过结合文档级和词元级置信信号处理多文档场景中的上下文内部冲突,并引入事实冲突问答基准DRQA。
作者反思了人们为何会信任听起来自信的AI答案,尤其是在金融领域,并介绍了他们的项目AutoFlow——一个信用证据引擎,旨在根据源证据验证金融主张并突出矛盾。
本文证明,诸如期望校准误差(Expected Calibration Error)等全局校准指标会受到模型精度的混杂影响,并提出了ACE,一个用于公平比较大语言模型的精度控制评估框架。
本文提出TriageRA-CCF,一种用于医学问答中LoRA自适应秩预算的方法。它利用源端信号(基座模型置信度、临床覆盖、反事实代理)动态选择秩预算,在Qwen3-8B和Llama3.1-8B上取得了适度的准确率提升。
作者批评了让智能体记住一切的想法,并介绍了TrueMemory,这是一个将记忆转化为带有置信度和证据的特质主张的系统,旨在更好地校准智能体行为。
一位开发自主计费代理的开发者讨论了事后重建代理决策原因的困难,并描述构建了一个工具(Attova),该工具记录决策的证据、替代方案和置信度,以改进调试和人工审查。
本文研究了前沿大语言模型是否表现出个体化元认知——即超越共享信号评估自身项目级别能力的能力。通过对20个模型和六个基准进行因子分析和成对校准,作者未发现此类元认知的证据;置信度差异归结为一个单一的共享难度因子,表明模型依赖于共同的难度信号而非模型特定的自我认知。
反思许多AI模型如何更注重听起来自信而非真实,以Claude为例,它似乎更注重内部一致性和逻辑诚实。
提出了CSR,一种直接在语义空间中使用新颖的语义校准奖励来校准LLM的框架,在多个数据集上将ECE降低了高达40%,并将AUROC相较于口头化置信度基线提升了高达31%。
阿明·罗纳赫(@mitsuhiko)建议,人们在提交拉取请求时应坦诚说明自己对话题的实际理解,因为AI工具(称为'clanker')让人很容易在缺乏真正知识的情况下显得很自信。
文章讨论了一场宴会上,富二代被安排在马斯克和黄仁勋旁边却缺乏交流,对比第一代创业者如马云、张朝阳等人的自信,引发对两代企业家差异的讨论。
本文发现语言模型中的策略蒸馏(OPD)因训练与部署信息不匹配导致严重过度自信,提出校准感知框架 CaOPD,在提升性能的同时显著增强置信度可靠性。