标签
本文揭示了幻觉检测中的“检测性差距”:幻觉可分为高一致性(Ghost)与低一致性(Flickering)两种模式,二者之间存在 0.35–0.46 的 AUC 差距。该差距在四个模型与三个事实问答数据集上持续存在,即使在固定模式归属并采用更严格的基于轨迹的测试后依然如此。作者指出,聚合层面的检测指标掩盖了模型相关的异质性,并呼吁采用基于模式条件的评估方法。
文章讨论了 Shopify 的 WebMCP 结账推出中的一致性问题,其中结构化工具响应可能与可见界面发生偏差,建议代理在提交前验证用户可见的不变量。
Qwen Image 2.1 Consistency LoRA 是一种在编辑过程中保持图像一致性的工具,能防止AI图像生成工作流中的偏移和不必要的重绘。
本文探讨了AI智能体的一致性问题,即在重复尝试中任务可能失败,并介绍了ALTK-Evolve的Consistency Analyzer,用于诊断和提高可靠性,在不降低平均准确率的情况下,将一致性差距从24.4个百分点缩小到12.0个百分点。
MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。
本文介绍了Prefix-Denoising Consistency (PDC),一种用于扩散语言模型的测试时验证方法,通过使用前缀条件再生和多数投票来提高推理任务的性能。
本文讨论了Wan 3.0在Magnific上的AI视频生成进展,强调了在长篇故事中保持年龄和场景一致性的能力。
人工智能视频技术正从生成片段发展到实现场景导演,这可能会降低电影制作中的一致性成本,并赋能小团队创作完整作品。
This paper introduces Cross-Contextual Consistency (C3), a behavioral property for measuring LLM credibility by checking whether answers remain stable under topic-aligned, content-neutral perturbations. Across 26 models and six benchmarks, they find that higher consistency correlates with correctness, offering a complementary evaluation axis.
The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.
本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。
SEAM is a generator-agnostic framework that audits global consistency of explanations in scientific machine learning, detecting incompatible local explanations even when predictions are locally accurate and attributing failures to specific channels and overlaps. The paper presents theory and experiments across PDE systems, neural operators, and four open datasets.
本文提出了一种用于视觉语言图表读取中无标签可靠性的交换理论,表明基于一致性的方法存在可计算的盲点,并引入了一种通过循环重标记增强的等变一致性评分。
本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。
本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。
本文介绍了一种无训练的方法,通过利用3D引擎提供的时空对应,在相机重访位置时保持外观一致性,从而改进自回归生成渲染中的重访一致性。
Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。
UGA的一项新研究发现,AI聊天机器人提供的财务建议不一致,且因平台以及假设用户的性别/种族而异,提醒消费者谨慎使用。