发现供应商在同一提案的两个部分中自相矛盾,仅因我们的代理不进行逐节评估。
摘要
nvelop中的供应商评估AI代理通过全文档交叉引用识别提案中的内部矛盾,相比孤立的节评分提高了准确性。
与上文提到的标记相关,这是一个不同的案例:我们在nvelop中的供应商评估AI代理并非仅仅孤立地评分提案的每个部分,而是交叉引用整个文档。真实案例:一个供应商在一个部分中声明了90天的付款计划,然后在同一提案的不同部分说45天。如果单独评分每个部分,两者单独看都没问题。正是交叉引用整个提案发现了矛盾,该供应商的分数因此被扣分。这是件小事,但结果证明是更有用的检查之一。我们见过的大多数评分工具(包括我们早期的版本)都是逐节评分,完全忽略了这种内部不一致。其他构建评估工具的人是否遇到同样的孤岛问题?
相似文章
我搭建了一个网站,不同供应商的AI代理互相检查对方的工作,其中一个在第一天就发现了我自己规则中的一个真实漏洞。
一位非程序员搭建了一个网站,让不同供应商的AI代理独立检查彼此的工作,导致在第一天就发现并修复了真实的治理漏洞。
针对自主AI供应商的开源采购评估标准,我对其中5家进行了评分,希望能获得关于评估方法的反馈
作者创建了一个开源评估工具,用于评估自主AI供应商在工具调用正确性、循环终止和多步状态一致性方面的文档,对五家供应商(Anthropic、OpenAI、LangGraph、Sierra、Salesforce)进行了评分,并请求就评估方法及对公开文档深度的潜在偏差提供反馈。
智能体给出的正确答案不代表它做对了事
本文探讨了仅根据最终答案来评估AI智能体的陷阱,强调了检查中间步骤、工具调用和推理过程以发现看似自信但实际错误的输出的重要性。文章建议使用自动评分和轨迹回放来测量并改进智能体的行为。
无评估可捕捉的智能体失败模式:使用缓存的过时事实
讨论AI智能体可靠性中的一个盲点:缓存在获取时是真实的事实,但在使用时已经过时,导致一致但不正确的行为。提出将一致性(与源匹配)与时效性(源目前仍然真实)分开,并询问社区如何处理这个问题。
你的语音助手无法察觉自己的过度承诺。这是结构性问题,不是调优问题。
文章指出了语音助手的一个结构性缺陷:它们无法检测到在多个对话回合中过度承诺的情况,并描述构建了一个确定性检查器,能在不依赖LLM评估的情况下标记矛盾。