标签
本文提出了AdaThinking-E,这是一个强化学习框架,利用单令牌熵调节使多模态大型语言模型实现自适应思考,从而在复杂任务上提高准确性,在简单任务上提高效率。
EntroRouter 提出了一个单轮模型路由框架,利用熵调控来平衡准确性和计算成本,在降低 48.25% 成本的同时,达到了最强专家模型 98.3% 的准确率。