标签
This paper introduces Cross-Contextual Consistency (C3), a behavioral property for measuring LLM credibility by checking whether answers remain stable under topic-aligned, content-neutral perturbations. Across 26 models and six benchmarks, they find that higher consistency correlates with correctness, offering a complementary evaluation axis.
The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
SEAM is a generator-agnostic framework that audits global consistency of explanations in scientific machine learning, detecting incompatible local explanations even when predictions are locally accurate and attributing failures to specific channels and overlaps. The paper presents theory and experiments across PDE systems, neural operators, and four open datasets.
本文提出了一种用于视觉语言图表读取中无标签可靠性的交换理论,表明基于一致性的方法存在可计算的盲点,并引入了一种通过循环重标记增强的等变一致性评分。
本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
本文介绍了一种无训练的方法,通过利用3D引擎提供的时空对应,在相机重访位置时保持外观一致性,从而改进自回归生成渲染中的重访一致性。
Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。
UGA的一项新研究发现,AI聊天机器人提供的财务建议不一致,且因平台以及假设用户的性别/种族而异,提醒消费者谨慎使用。
讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。
This paper introduces logical physical clocks and methods for consistent snapshots in globally distributed databases, addressing causality and consistency challenges.
本文引入结构不确定性框架,通过测量采样推理解中自偏好排名的稳定性来评估LLM推理一致性,补充了传统的答案离散度方法,用于识别不可靠的推理。
本文分析了大型视觉语言模型中多模态可验证奖励强化学习(RLVR)中的思考-答案不一致性,并提出CORA方法,该方法引入了一致性奖励模型和混合奖励优势拆分,以提高忠实性和任务性能。
PermaVid 引入了一种多模态上下文记忆,将外观和几何结构解耦,从而在编辑操作后保持长期视频一致性,超越了此前的方法。
本文利用基于交互的解释方法,研究了不同LLM在预测相同词元时是否共享共同的推理模式。结果表明,先进LLM展现出一致的交互模式,暗示它们隐式地优化到了共享的推理机制。
探讨了AI智能体中被忽视的记忆卫生问题——长期存储导致上下文过时且不可靠,并质疑行业是否在忽视一个即将到来的全球性问题。
本文提出了一种神经符号框架,通过将一致性校正推迟到后提取阶段,从文本中构建基于本体的知识图谱,从而减少令牌使用,同时提高知识图谱的一致性并保持问答性能。