标签
本文介绍了Pre-Flight,这是一个包含300道多选题的开源基准测试,旨在评估大型语言模型在航空运行知识方面的表现,覆盖国际法规和地面操作。结果显示,即使是2026年最强模型也只能达到82.7%的准确率,远低于约95%的专家参考水平,突显了持续存在的可靠性差距。
介绍了Teach VLM,一种从移动屏幕演示中提取逐步操作知识的模型,以及Teach-and-Repeat范式,该范式利用这些知识指导GUI代理,在新基准上实现了最先进的性能。