标签
这项研究发现,AI代理通常失败是由于糟糕的上下文(指令、工具、证据等)而非模型本身,并提出一个跨七个维度的上下文评分系统,该系统与行为分数无关。从模糊的上下文切换到结构化的上下文,在300次测试中显著提高了代理的性能。