标签
本文研究了紧凑语言模型中的评估意识,发现较小的模型依赖格式敏感性,而较大的模型则使用上下文推理,并提出了一种双路径干预方法以抑制评估意识。
ClueWeaver是一个奖励引导的双智能体框架,通过将证据选择和推理分解为通过强化学习优化的独立智能体,使用紧凑型本地语言模型改进长篇叙事问答。