标签
本文介绍了RENDEQ,一种为科学图像生成渲染等价集的生成器,并测量了开放权重VLM中模型在语义保持的重渲染之间的一致性在多大程度上追踪正确性。研究发现,一致性仅在超过阈值时才证明正确性,而基于自一致性进行微调可能会损害准确率。
本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。
ModelEquivBench 是一个面向 LLM 生成优化模型的认证式多关系评估系统,报告逐对语义概况(涵盖七种等价关系),而非单一的准确率分数。它在固定基准上评估了 GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B,揭示了粗粒度基线无法发现的阶段式失败。
本文提出了一种基于迭代状态变换和语义等价的认知过程建模的结构动力学框架,融合了动力系统、范畴论和反馈机制,将认知建模为朝着稳定解释演化的过程。
爱丁堡大学研究人员提出了一种利用 Liquid Haskell 进行形式化验证的自博弈框架,用于训练 LLMs 的语义等价推理能力,同步发布了 OpInstruct-HSx 数据集(28k 个程序),并在 EquiBench 上实现了 13.3 个百分点的准确率提升。