标签
PersonalBench 是一个新的基准,通过作者身份验证、LLM-as-judge 和文体测量学来评估 LLM 中的推理时个性化方法。研究发现,虽然这些方法能产生作者区分的输出,但它们并未缩小与人类作者之间的差距。