structured-hallucination

标签

Cards List
#structured-hallucination

LinAlg-Bench:揭示大语言模型数学推理中结构性失败模式的诊断性基准

arXiv cs.AI · 2026-05-19 缓存

介绍了LinAlg-Bench,这是一个诊断性基准,用于评估10个前沿大语言模型在矩阵维度上的结构化线性代数计算,揭示了大语言模型的数学失败在结构上受到约束,并在4x4规模下从执行错误过渡到计算放弃。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈