标签
HarvestBench引入了一个基准,通过农场模拟评估LLM代理,以衡量它们愿意支付燃料来避免杀害动物的程度,结果显示不同模型的杀伤率因价格和道德简报而有所不同。
本文介绍了MoralSim,用于评估LLM智能体在道德冲突的社会困境中的行为表现,其中道德行为与利润激励相冲突,研究发现没有模型能始终保持道德,合作率差异很大。