paraphrase-robustness

标签

Cards List
#paraphrase-robustness

相同问题,不同答案:超越准确性评估LLM的可靠性

arXiv cs.AI · 4天前 缓存

本文研究了LLM在保持意义不变的改写下答案的变化,发现实例级行为不稳定(翻转率>23%),单提示准确性掩盖了显著的不一致性,而自我改写策略可以部分恢复潜在知识。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈