subjective-assessment

标签

Cards List
#subjective-assessment

推理是否能提升大型语言模型的心理深度?这取决于评判者是谁。

arXiv cs.LG ↗ · 2026-09-15 缓存

研究调查了LLM-as-a-Judge评估者是否能可靠地评估LLM生成故事的心理深度,揭示了人类偏好的异质性,而评判者则基于表层特征对推理输出表现出偏见。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈