标签
本文提出了一种条件概化框架,用于在自动作文评分中评估不同作答条件下的非一致信度。
系统研究表明,基于大模型的稠密检索器在拼写错误和投毒攻击上优于 BERT 基线,但仍易受语义扰动影响,其嵌入几何形态可预测鲁棒性。