发现供应商在同一提案的两个部分中自相矛盾,仅因我们的代理不进行逐节评估。

Reddit r/AI_Agents 工具

摘要

nvelop中的供应商评估AI代理通过全文档交叉引用识别提案中的内部矛盾,相比孤立的节评分提高了准确性。

与上文提到的标记相关,这是一个不同的案例:我们在nvelop中的供应商评估AI代理并非仅仅孤立地评分提案的每个部分,而是交叉引用整个文档。真实案例:一个供应商在一个部分中声明了90天的付款计划,然后在同一提案的不同部分说45天。如果单独评分每个部分,两者单独看都没问题。正是交叉引用整个提案发现了矛盾,该供应商的分数因此被扣分。这是件小事,但结果证明是更有用的检查之一。我们见过的大多数评分工具(包括我们早期的版本)都是逐节评分,完全忽略了这种内部不一致。其他构建评估工具的人是否遇到同样的孤岛问题?
查看原文

相似文章

智能体给出的正确答案不代表它做对了事

Reddit r/AI_Agents

本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。

无评估可捕捉的智能体失败模式:使用缓存的过时事实

Reddit r/AI_Agents

讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。