self-consistency

标签

Cards List
#self-consistency

小型视觉语言模型在多语言视觉多选题上的测试时扩展

arXiv cs.CL · 2026-07-13 缓存

本文研究了在面向多语言视觉多选题基准EXAMS-V上,针对小规模开放视觉语言模型(参数量≤7B)的测试时扩展技术。研究发现,推理预算和可解析性比复杂的搜索或验证方法更为重要。最佳配置在ImageCLEF 2026测试集上达到84.1%的准确率,在排行榜上排名第一。

0 人收藏 0 人点赞
#self-consistency

我们能否信任LLM的逻辑?通过基于图的框架量化不确定性、一致性和稳健性

arXiv cs.CL · 2026-07-10 缓存

本文介绍了GraphEVAL,一个基于图的框架用于量化LLM推理中的不确定性,并提出了一种新的指标——图推理一致性得分(GRCS),该指标捕捉语义-结构共识并检测自信幻觉。作者还提出了图自一致性(GSC),一种优先考虑推理忠实度而非名义准确性的解码策略。

0 人收藏 0 人点赞
#self-consistency

文本到SQL正确性的预测因素:一项选择性预测研究

arXiv cs.LG · 2026-07-09 缓存

本文研究了在选择性预测中哪些信号最能预测文本转SQL的正确性。研究发现,来自LLM判断器的基于验证的信号优于黑盒统计信号(如自一致性),并且双提供者集成模型实现了0.82的AUROC,同时具有良好校准的概率。

0 人收藏 0 人点赞
#self-consistency

@jchudnov: Pass@k 和自洽性在数学和代码上效果很好;多采样并验证。于是我们问:同样的技巧能否扩展……

X AI KOLs Following · 2026-07-05 缓存

一篇新论文显示,通过自洽性等方法扩展推理计算提高了LLM在数学和代码上的准确性,但在没有外部验证器的领域未能提高真实性,因为模型错误过于相关。

0 人收藏 0 人点赞
#self-consistency

@charles_irl: kino

X AI KOLs Timeline · 2026-07-04 缓存

Ali 将 Claude Fable 5 的推理轨迹蒸馏到 Qwen3-4B 中,声称实现了100%的自洽性和零幻觉方差,并将结果开源。

0 人收藏 0 人点赞
#self-consistency

SFL-MTSC:利用语义框架级多任务自一致性实现鲁棒的多意图口语理解

arXiv cs.CL · 2026-06-25 缓存

介绍了一种结构化聚合框架SFL-MTSC,该框架利用LLM在语义框架级别的自一致性实现鲁棒的多意图口语理解,在MAC-SLU基准测试上显示出改进的槽位F1得分和整体准确性。

0 人收藏 0 人点赞
#self-consistency

MARS: 面向并行LLM测试时扩展的边际对抗风险控制停止策略

arXiv cs.AI · 2026-06-12 缓存

本文提出MARS,一种用于并行LLM测试时扩展的停止规则,通过探测部分轨迹来提前停止而不牺牲准确性,在竞赛数学基准测试上为推理模型节省25-47%的令牌。

0 人收藏 0 人点赞
#self-consistency

将未来行为预测作为学习任务

arXiv cs.AI · 2026-06-11 缓存

本文提出了 Behavior Forecasters,一种从推理轨迹中预测 LRM 未来行为(如答案一致性和输入敏感性)的学习方法,以更低的成本超越了 GPT-5.4 和 Claude Opus 4.6。

0 人收藏 0 人点赞
#self-consistency

KACE:面向数学推理的知识自适应上下文工程

arXiv cs.AI · 2026-06-02 缓存

KACE 引入了一种知识自适应上下文工程方法,通过认知树和分层自一致性将存储与使用分离,在 AIME 2025 上达到了 62.2% 的准确率——相比固定自一致性提升了 10.4 个百分点。

0 人收藏 0 人点赞
#self-consistency

超越共识:混合智能体中的轨迹级综合

arXiv cs.AI · 2026-05-29 缓存

本文揭示,聚合多个LLM智能体的完整推理轨迹(而非仅其最终答案)即使在所有智能体一致同意的情况下也能纠正错误,引入了“聚合悖论”以及Self-Consistent Mixture of Agents方法。

0 人收藏 0 人点赞
#self-consistency

跨语言共识:通过多语言自一致性对齐多语言文化知识

arXiv cs.CL · 2026-05-22 缓存

本文提出一个自监督框架,利用多语言自一致性和自我批评机制在不同语言间迁移文化知识,通过从本地语言表征中揭示潜在文化知识,在BLEnD基准测试的英语查询中平均提升5.03%。

0 人收藏 0 人点赞
#self-consistency

通过前缀一致性实现可靠的思维链

Hugging Face Daily Papers · 2026-05-08 缓存

本文介绍了“前缀一致性”这一方法,它根据思维链推理中痕迹再生成时的答案重现率对候选响应进行加权。该方法在各种推理模型和基准测试中,以显著少于标准多数投票的令牌数实现了高准确率。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈