semantic-equivalence

标签

Cards List
#semantic-equivalence

共识何时意味着正确性?通过语义保持的重渲染测量一致性与准确性的耦合

arXiv cs.LG · 2026-08-07 缓存

本文介绍了RENDEQ,一种为科学图像生成渲染等价集的生成器,并测量了开放权重VLM中模型在语义保持的重渲染之间的一致性在多大程度上追踪正确性。研究发现,一致性仅在超过阈值时才证明正确性,而基于自一致性进行微调可能会损害准确率。

0 人收藏 0 人点赞
#semantic-equivalence

通过语义等价的对抗性攻击诱发LLM的内在幻觉

arXiv cs.CL · 2026-08-06 缓存

本文提出了一种利用语义等价的对抗性扰动来诱发LLM内在幻觉的框架,表明即使保持查询含义不变,最先进的模型在上下文忠实度上也会显著下降。

0 人收藏 0 人点赞
#semantic-equivalence

ModelEquivBench:LLM生成优化模型的认证式多关系评估

arXiv cs.AI · 2026-08-03 缓存

ModelEquivBench 是一个面向 LLM 生成优化模型的认证式多关系评估系统,报告逐对语义概况(涵盖七种等价关系),而非单一的准确率分数。它在固定基准上评估了 GPT-5.4、Claude Sonnet 4.6 和 Qwen3.5-397B-A17B,揭示了粗粒度基线无法发现的阶段式失败。

0 人收藏 0 人点赞
#semantic-equivalence

基于变换与语义等价的认知过程动力学框架

arXiv cs.AI · 2026-05-26 缓存

本文提出了一种基于迭代状态变换和语义等价的认知过程建模的结构动力学框架,融合了动力系统、范畴论和反馈机制,将认知建模为朝着稳定解释演化的过程。

0 人收藏 0 人点赞
#semantic-equivalence

# 结合语义等价自博弈与形式化验证提升 LLM 代码推理能力

arXiv cs.CL · 2026-04-21 缓存

爱丁堡大学研究人员提出了一种利用 Liquid Haskell 进行形式化验证的自博弈框架,用于训练 LLMs 的语义等价推理能力,同步发布了 OpInstruct-HSx 数据集(28k 个程序),并在 EquiBench 上实现了 13.3 个百分点的准确率提升。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈