标签
本文介绍了面向上下文强化学习的任务特化微调(TSFT),该框架利用一个简单的参数模型和整数线性规划高效分配微调预算,在任务覆盖方面显著超越基线方法。
本文引入了一个框架,将复合逻辑答案选项分解为原子判断,并使用受算子约束的整数线性规划来改进大语言模型在 AND、OR 以及 NEITHER/NOR 算子上的推理能力。该框架在 LOGICAL-COMMONSENSEQA 和新的基准 LOGICAL-SATA 上取得了显著的 F1 提升。
这篇博客文章提出一个使用整数线性规划的算法来计算语言模型的最优分词器,并将其与解决旅行商问题相类比。文中指出,虽然结果在理论上很有趣,但实际的分词器已经接近最优,并且该方法可能不具备良好的泛化能力。