一个LLM编写了交易功能,另一个审查了它,两者都错过了未来数据漏洞

Reddit r/LocalLLaMA 论文

摘要

这篇文章讨论了一篇研究论文,其中用于编写和审查交易功能的LLM错过了未来数据漏洞,强调了需要在代理系统中进行结构性重新设计以防止此类问题。

一个AQuA研究循环让一个LLM编写了一个日内交易功能,另一个LLM审查其因果关系。该功能将目前看到的成交量除以当日的最终总成交量。在预测时,该最终总成交量包括了当天晚些时候的交易:未来数据。审查者批准了听起来因果的解释。然后,该功能在干净的重新划分中失去了其不寻常的信号,人工审计发现了泄露。这留下了一个真正的选择:构建一个更智能的审查者,还是给代理一个更小、更安全的工具集?这不仅仅是“LLM会犯错误”。两个模型角色对一个看似合理的解释达成了一致,而实际的漏洞存在于编写代理允许表达的操作中。一个更强大的因果审查仍然必须重建该分母背后的数据流。AQuA v2从结构上回应。论文指出,数据划分、特征和标签定义以及评估器被密封在代理的自适应表面之外。任意特征代码被替换为因果算子的固定注册表。在该规范空间中,全天候归一化器不是一个可用的操作。该保证受限于实现的注册表和沙盒。它也创造了一个成本。注册表可以使已知无效的转换不可能发生,但每个限制都缩小了代理可以发明的范围。一个更好的审查者保留更多的搜索空间,但必须可靠地捕捉微妙的依赖关系。论文是“AQuA: Recursively Self-Improving Quantitative Trading Research Agents” by Guo et al. (arXiv:2608.12841)。附录B没有发布失败功能的数值IC。值得阅读的是从令人信服的错误信号到接口重新设计的记录路径,而不是关于实时交易性能的声明。如果你在设计这个循环,你会将复杂性预算花在哪里:一个具有静态数据流检查的更强大审查者、一个更小的类型化工具集,还是一个混合方案?什么失败会让你改变立场?
查看原文

相似文章

智能体交易:当LLM智能体遇上金融市场

arXiv cs.AI

本文对77项关于基于LLM的交易智能体的研究进行了系统综述和证据图谱,发现架构实验正在快速扩展,但评估协议、执行语义和可再现性仍然是关键瓶颈。