你的LLM功能可能不是确定性的,而你却不知道。我在开发一个金融科技AI时学到的:如何让AI给出相同的答案两次

Reddit r/ArtificialInteligence 工具

摘要

一位开发者分享了在让分析交易图表的AI给出一致答案时学到的经验。修复方法包括将温度设置为0并在所有管道阶段使用固定种子,并强调确定性是一种信任特性,必须与基于真实数据的接地相结合。

我构建了一个读取交易图表截图的AI。有用户指出,上传同一张截图两次却得到了不同的支撑位。我检查了一下,他说得没错,而这个修复过程让我学到了适用于任何LLM产品的东西,所以写下这篇文章。bug:我的视觉调用没有设置温度。OpenAI默认使用1.0,这是最大的采样方差,而我的第二阶段运行在0.4。我从未发现这个问题,因为你不会用同样的输入测试两次,总是拿一个新的例子。但你的用户会这样做,对于任何看起来像是分析的东西,不一致性读起来就是无能。修复其实有两个:将温度设为0,并在管道中的每次调用中使用固定种子。仅仅一个阶段温度为0是不够的,任何下游阶段温度高于0都会重新随机化最终输出。种子在OpenAI方面是尽力而为,但在温度为0时能进一步收紧结果。发布后我学到的是:确定性是一种信任特性,而不是精确性特性。一个错误的读取现在每次都以同样的方式出错,这可能让它看起来比实际更有信心。所以下一层是接地,将模型声称看到的东西与真实数据源进行核对,就我而言,是对已识别股票代码的真实OHLCV蜡烛图。如果像素和数据不一致,诚实的输出应该是“无法可靠读取”,而不是一个干净的猜测。一位评论者还给了我一个调试技巧:当核对失败时,针对2-3个最可能的时间间隔重新运行。如果其中一个完全吻合,说明你的时间间隔检测有误;如果都不吻合,说明模型的读取有误。这就能将“有些不对劲”转化为“这里不对劲”。任何LLM产品的通用清单:了解每次调用的实际运行温度,在持续集成中使用相同输入进行测试,并将模型自报的置信度视为营销宣传,直到对照真实数据进行了核对。背景:产品是Bullynx,一个AI图表分析工具,仅用于教育目的。但这篇文章的重点是清单,它适用于你在LLM之上构建的任何东西。很好奇大家在生产环境中如何实现LLM的确定性,尤其是那些发现温度为0时仍然无法重现的情况。
查看原文

相似文章

让AI自动化消失

Hacker News Top

本文讨论了将非确定性LLM与确定性工具和正式工作流相结合以自动化AI开发的理念,并以Beagle SCM为例。它建议让LLM自行自动化消失,转而采用可靠的确定性流程。

尽可能使代理具有确定性的最佳尝试

Reddit r/AI_Agents

本文讨论了使基于LLM的代理更具确定性的各种技术,例如黄金数据集、护栏、共识机制、回归测试、编码逻辑和超参数调优,并询问其他成功的方法。