标签
本文审计了多个模型在金融新闻自然语言处理基准中的时间泄漏,发现随机划分会夸大性能指标,并确定并购事件是在时序评估下具有局部正向信号的一个类别。
本文表明,在LLM回测中,标准的前/后训练截止检查对时间泄漏的检测毫无信息量,因为近因效应会模仿泄漏。文章提出了使用已知截止点和匹配的干净对照组的新估计器,以测量泄漏并计算调整分数,并在前沿模型上进行了验证。