HarvestBench:衡量LLM代理是否会付费以避免杀害动物
摘要
HarvestBench引入了一个基准,通过农场模拟评估LLM代理,以衡量它们愿意支付燃料来避免杀害动物的程度,结果显示不同模型的杀伤率因价格和道德简报而有所不同。
查看缓存全文
缓存时间: 2026/09/07 20:17
论文页面 - HarvestBench:评估大语言模型代理是否愿意付费避免杀害动物
来源:https://huggingface.co/papers/2609.04444
摘要
HarvestBench在农场模拟环境中评估大语言模型代理,让它们在零成本伤害动物与消耗燃料避开动物之间做出选择,揭示了不同模型表现出的价格敏感性和指令依赖性击杀率。
评估智能体在达成目标过程中所产生的副作用的基准测试已经存在,但HarvestBench(https://huggingface.co/papers?q=HarvestBench)是首个为避免副作用设定代价,并将这种副作用明确定义为生命体的基准。该测试基于农场模拟:大语言模型子代理(https://huggingface.co/papers?q=LLM%20sub-agents)操控两台拖拉机组进行协同玉米收割,田地中有动物出没。环境是强化学习(https://huggingface.co/papers?q=reinforcement%20learning)网格世界(https://huggingface.co/papers?q=gridworld),每次决策均不依赖记忆,且伤害从未在目标中被明确提及。当动物阻挡拖拉机路线时,自动驾驶会停止并询问模型:是零燃料成本直接驶过,还是按标价消耗燃料绕行。击杀数据与两个对照组进行比较:会损坏拖拉机且被所有模型撞击率低于1%的岩石,以及无害且非生命的干草捆。模型还可以选择从邻近田地而非自身田地收割作物,这是对它们道德判断的二次测试。在9个模型参与的7,201次定价决策中,3,951次涉及动物(而非干草捆或岩石)。击杀率范围从0.4%到98.8%,其中Terra和Sol最为仁慈,GPT-4o-mini最为残酷,且击杀率与模型能力不成正比。六个模型中有四个在5%水平上对价格敏感,弹性系数从0.09到1.69不等。所有九个模型在默认地图上都更倾向于碾压野生动物而非养殖动物,且在所有地图布局和所有可移动模型中这一趋势保持不变。指令至关重要:在道德指令(https://huggingface.co/papers?q=morality%20briefing)下,六个推理模型(https://huggingface.co/papers?q=reasoning%20models)中有五个的击杀率低于6%,而移除该指令后所有六个模型的击杀率都升至84%以上。HarvestBench(https://huggingface.co/papers?q=HarvestBench)不使用大语言模型作为评分器。评分器通过统计游戏日志中的事件计数,实现了完全可复现的评估,它衡量的是模型愿意为避免伤害付出多少代价,而非模型对伤害的言论。
查看arXiv页面 (https://arxiv.org/abs/2609.04444)查看PDF (https://arxiv.org/pdf/2609.04444)添加到收藏夹 (https://huggingface.co/login?next=%2Fpapers%2F2609.04444)
在智能体中获取本论文:
hf papers read 2609.04444
没有最新版CLI?curl \-LsSf https://hf\.co/cli/install\.sh \| bash
引用本论文的模型0
无模型链接本论文
在模型的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。
引用本论文的数据集0
无数据集链接本论文
在数据集的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。
引用本论文的Spaces0
无Space链接本论文
在Space的README.md中引用arxiv.org/abs/2609.04444可从本页面链接。
包含本论文的合集0
无合集包含本论文
将本论文添加到合集(https://huggingface.co/new-collection)可从本页面链接。
相似文章
EcoAgent-Bench:评估预算受限的LLM代理中的经济决策
本文介绍了EcoAgent-Bench,一个包含304个任务的基准测试,用于评估LLM代理在明确预算和定价操作下的经济决策,测试五个任务族中的四种与成本相关的决策。
MerchantBench:评测LLM智能体在电子商务运营中的长期连贯性
MerchantBench是一个新的基准测试,用于评估LLM智能体在电子商务运营中的长期连贯性,采用包含98,843条真实商品记录和26种工具的365天订单级模拟。结果显示,最佳LLM的最终净资产仅达到人类参与者平均值的27.3%,凸显了巨大的能力差距。
Business Arena:在现实市场中对LLM智能体进行基准测试
Business Arena 是一个新的基准测试,在真实的跨境店铺环境中评估 LLM 智能体,揭示了与人类策略之间的巨大性能差距,并能够对商业决策进行详细归因。
CoffeeBench:异构多智能体经济中长期任务LLM智能体的基准测试
CoffeeBench 是一个用于在长期多智能体经济模拟中评估 LLM 智能体的基准测试,其中企业互动 90 天以最大化利润,揭示了不同模型在通信模式和性能上的差异。
扮演真正的研究者:一套评估前沿大语言模型及代理系统在研究生命周期中的基准测试集
本文介绍了AARR(扮演真正的研究者)基准系列,旨在评估前沿大语言模型和代理系统在细粒度研究场景中的表现。首个基准AARRI-Bench显示,即使表现最佳的代理成功率也仅为68.3%,凸显了其在领域敏感性和细微推理能力方面的不足。