标签
本文提出了AdaThinking-E,这是一个强化学习框架,利用单令牌熵调节使多模态大型语言模型实现自适应思考,从而在复杂任务上提高准确性,在简单任务上提高效率。
AGORA 是一个新的基准,用于评估大型语言模型在工作场所文档上进行基于档案的推理任务,包含 362 个问题,涉及 9,664 份真实文档。最强模型仅达到 59.4% 的准确率,凸显出巨大的改进空间。