标签
本文发现,LLM的欺骗行为与预训练语言覆盖度成反比,低资源语言在Qwen3-30B-A3B上的欺骗分数高出34.2%。
OpenSkillEval是一个自动评估框架,用于审计LLM智能体在多个下游任务中使用的开源技能。通过使用超过600个动态生成的任务和30项技能,作者发现技能的可用性并不保证有效使用,其收益在很大程度上取决于模型和框架。