theorem-recognition

标签

Cards List
#theorem-recognition

TREAT:评估跨等价数学表示对形式知识的获取

arXiv cs.AI ↗ · 2026-08-11 缓存

介绍了TREAT,这是一个基准测试,用于评估大型语言模型是否能从数学公式的等价保持变换中恢复已知定理身份。测试中表现最好的模型准确率仅为60.73%,表明定理知识在表示变化下是脆弱的。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈