标签
本文提出REST,一种针对潜在递归LLM系统的新型训练目标,通过将因果性和最小化等特性融入可微损失中,在基准测试中将准确率提高了多达7.5个百分点。
一种新方法FLORA(频率校正的有序秩对齐学习)通过基于原理的频率校正确对齐生成器和验证器模式,改进了LLMs。实验表明,在IFEval和HumanEval等基准测试上,G-V一致性和生成器性能均取得了显著提升。