一个LLM编写了交易功能,另一个审查了它,两者都错过了未来数据漏洞
摘要
这篇文章讨论了一篇研究论文,其中用于编写和审查交易功能的LLM错过了未来数据漏洞,强调了需要在代理系统中进行结构性重新设计以防止此类问题。
一个AQuA研究循环让一个LLM编写了一个日内交易功能,另一个LLM审查其因果关系。该功能将目前看到的成交量除以当日的最终总成交量。在预测时,该最终总成交量包括了当天晚些时候的交易:未来数据。审查者批准了听起来因果的解释。然后,该功能在干净的重新划分中失去了其不寻常的信号,人工审计发现了泄露。这留下了一个真正的选择:构建一个更智能的审查者,还是给代理一个更小、更安全的工具集?这不仅仅是“LLM会犯错误”。两个模型角色对一个看似合理的解释达成了一致,而实际的漏洞存在于编写代理允许表达的操作中。一个更强大的因果审查仍然必须重建该分母背后的数据流。AQuA v2从结构上回应。论文指出,数据划分、特征和标签定义以及评估器被密封在代理的自适应表面之外。任意特征代码被替换为因果算子的固定注册表。在该规范空间中,全天候归一化器不是一个可用的操作。该保证受限于实现的注册表和沙盒。它也创造了一个成本。注册表可以使已知无效的转换不可能发生,但每个限制都缩小了代理可以发明的范围。一个更好的审查者保留更多的搜索空间,但必须可靠地捕捉微妙的依赖关系。论文是“AQuA: Recursively Self-Improving Quantitative Trading Research Agents” by Guo et al. (arXiv:2608.12841)。附录B没有发布失败功能的数值IC。值得阅读的是从令人信服的错误信号到接口重新设计的记录路径,而不是关于实时交易性能的声明。如果你在设计这个循环,你会将复杂性预算花在哪里:一个具有静态数据流检查的更强大审查者、一个更小的类型化工具集,还是一个混合方案?什么失败会让你改变立场?
相似文章
超越智能体架构:基于LLM的交易系统中的执行假设与可重复性
本文综述并审计了基于LLM的交易研究中的执行现实性,提出了更清晰的报告标准以提升可重复性和评估可比性。
捉住五分之一:LLM作为判断器在生产环境多轮交易代理中的盲点
本文研究了一个部署的LLM作为判断器系统,用于评估多轮对话代理,发现其捕捉到的缺陷远少于人工审查,揭示了一个结构化的盲点分类和路由故障。
智能体交易:当LLM智能体遇上金融市场
本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。
@bcherny:LLM 仍然会产生 bug,但这些 bug 与过去不同。差一错误变少了,更多的是关于 s…
一位开发者观察到,LLM 生成的 bug 已从差一错误转向更高层次的设计和上下文问题,并建议使用对抗性代码审查(例如 Claude 的 /code-review)来捕获这些 bug。
@DanKornas: 单个LLM可以将市场数据、讨论和风险模糊成一个不透明的答案。这个仓库将工作分散到专门的……
TradingAgents 是一个开源的金融分析多智能体LLM框架,将市场数据通过专门的智能体进行路由以进行研究。