consistency

标签

Cards List
#consistency

检测性差距:大语言模型幻觉检测中隐藏的异质性

arXiv cs.CL ↗ · 2天前 缓存

本文揭示了幻觉检测中的“检测性差距”:幻觉可分为高一致性(Ghost)与低一致性(Flickering)两种模式,二者之间存在 0.35–0.46 的 AUC 差距。该差距在四个模型与三个事实问答数据集上持续存在,即使在固定模式归属并采用更严格的基于轨迹的测试后依然如此。作者指出,聚合层面的检测指标掩盖了模型相关的异质性,并呼吁采用基于模式条件的评估方法。

0 人收藏 0 人点赞
#consistency

如果 WebMCP 和可见的结账界面不一致,代理应该相信哪个?

Reddit r/AI_Agents ↗ · 3天前

文章讨论了 Shopify 的 WebMCP 结账推出中的一致性问题,其中结构化工具响应可能与可见界面发生偏差,建议代理在提交前验证用户可见的不变量。

0 人收藏 0 人点赞
#consistency

@wildmindai: Qwen Image 2.1 Frame-Lock LoRA 将编辑固定到原始帧,确保没有偏移; - 相同提示/编辑,零移动 - …

X AI KOLs Timeline ↗ · 3天前 缓存

Qwen Image 2.1 Consistency LoRA 是一种在编辑过程中保持图像一致性的工具,能防止AI图像生成工作流中的偏移和不必要的重绘。

0 人收藏 0 人点赞
#consistency

你的智能体完美完成任务,但它能再次做到吗?

Hugging Face Blog ↗ · 2026-09-15 缓存

本文探讨了AI智能体的一致性问题,即在重复尝试中任务可能失败,并介绍了ALTK-Evolve的Consistency Analyzer,用于诊断和提高可靠性,在不降低平均准确率的情况下,将一致性差距从24.4个百分点缩小到12.0个百分点。

0 人收藏 0 人点赞
#consistency

长形式多镜头视频生成的多网格后训练

Hugging Face Daily Papers ↗ · 2026-09-06 缓存

MovieGrid是一种多网格后训练范式,它将长视频分解为空间排列的块,以提高多镜头的连贯性和效率,在视频生成中实现了最先进的镜头内和镜头间一致性。

0 人收藏 0 人点赞
#consistency

Prefix-Denoising Consistency:扩散语言模型的测试时验证

arXiv cs.LG ↗ · 2026-08-27 缓存

本文介绍了Prefix-Denoising Consistency (PDC),一种用于扩散语言模型的测试时验证方法,通过使用前缀条件再生和多数投票来提高推理任务的性能。

0 人收藏 0 人点赞
#consistency

@manishkumar_dev: 这是一个很好的例子,展示了AI视频生成如何超越短片段。同一面孔,三个年龄,13个场景,以及一个故事……

X AI KOLs Timeline ↗ · 2026-08-24 缓存

本文讨论了Wan 3.0在Magnific上的AI视频生成进展,强调了在长篇故事中保持年龄和场景一致性的能力。

0 人收藏 0 人点赞
#consistency

@heyshrutimishra: 电影行业的真正护城河从来不是摄影棚。而是保持一致性的成本,保持同一张脸、同一个世界……

X AI KOLs Timeline ↗ · 2026-08-17 缓存

人工智能视频技术正从生成片段发展到实现场景导演,这可能会降低电影制作中的一致性成本,并赋能小团队创作完整作品。

0 人收藏 0 人点赞
#consistency

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

arXiv cs.CL ↗ · 2026-08-12 缓存

This paper introduces Cross-Contextual Consistency (C3), a behavioral property for measuring LLM credibility by checking whether answers remain stable under topic-aligned, content-neutral perturbations. Across 26 models and six benchmarks, they find that higher consistency correlates with correctness, offering a complementary evaluation axis.

0 人收藏 0 人点赞
#consistency

Revision Prompting improves industrial LLM processes

Lobsters Hottest ↗ · 2026-08-08 缓存

The article introduces Revision Prompting, a technique for industrial LLM processes that improves speed, cost, and consistency when re-processing updated inputs by generating output patches from diffs.

0 人收藏 0 人点赞
#consistency

表格基础模型是否与自身一致?

arXiv cs.LG ↗ · 2026-08-07 缓存

本文研究了表格基础模型(TFMs)如 TabPFN、TabICL、TabDPT 和 TabFM 是否能够产生与任何联合分布一致的预测。结果表明,所有被评估的 TFM 在分类和回归任务中均违反了边际化一致性和分解一致性,从而对其贝叶斯推断的主张提出了质疑。

0 人收藏 0 人点赞
#consistency

SEAM: Global consistency beyond local accuracy in scientific machine learning

arXiv cs.LG ↗ · 2026-08-07 缓存

SEAM is a generator-agnostic framework that audits global consistency of explanations in scientific machine learning, detecting incompatible local explanations even when predictions are locally accurate and attributing failures to specific channels and overlaps. The paper presents theory and experiments across PDE systems, neural operators, and four open datasets.

0 人收藏 0 人点赞
#consistency

一致性存在可计算的盲点:视觉语言图表读取中无标签可靠性的交换理论

arXiv cs.LG ↗ · 2026-08-07 缓存

本文提出了一种用于视觉语言图表读取中无标签可靠性的交换理论,表明基于一致性的方法存在可计算的盲点,并引入了一种通过循环重标记增强的等变一致性评分。

0 人收藏 0 人点赞
#consistency

更快但不同:加速多模态扩散语言模型中内容漂移的诊断与控制

arXiv cs.CL ↗ · 2026-08-03 缓存

本文研究了无训练加速如何静默改变基于扩散的多模态大语言模型生成的内容,并提出了成对诊断和一致性控制方法来缓解内容漂移。

0 人收藏 0 人点赞
#consistency

一致性多参考图像编辑的评估-验证奖励

Hugging Face Daily Papers ↗ · 2026-07-31 缓存

本文提出一种多维评估-验证奖励(EVR),用于多参考图像编辑模型的强化学习微调,提升视觉一致性与和谐度。

0 人收藏 0 人点赞
#consistency

持续统一数千个智能体的工作

Reddit r/AI_Agents ↗ · 2026-07-28

描述了一种方法,用于在并行预测任务中统一数千个智能体的输出,通过后处理和同质任务设计实现一致性和成本效率。

0 人收藏 0 人点赞
#consistency

相同问题,不同答案:超越准确性评估LLM的可靠性

arXiv cs.AI ↗ · 2026-07-28 缓存

本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。

0 人收藏 0 人点赞
#consistency

闭环:无训练的自回归生成渲染重访一致性

Hugging Face Daily Papers ↗ · 2026-07-23 缓存

本文介绍了一种无训练的方法,通过利用3D引擎提供的时空对应,在相机重访位置时保持外观一致性,从而改进自回归生成渲染中的重访一致性。

0 人收藏 0 人点赞
#consistency

Hallo4D: 多模态幻觉缓解实现一致时空生成

Hugging Face Daily Papers ↗ · 2026-07-15 缓存

Hallo4D是一个模型无关框架,利用大型多模态语言模型检测和纠正3D与4D生成中的空间和时间幻觉,在无需重新训练的情况下改善跨视角和时间的一致性。

0 人收藏 0 人点赞
#consistency

UGA新研究显示AI聊天机器人的财务建议缺乏一致性

Reddit r/ArtificialInteligence ↗ · 2026-07-08 缓存

UGA的一项新研究发现,AI聊天机器人提供的财务建议不一致,且因平台以及假设用户的性别/种族而异,提醒消费者谨慎使用。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈