标签
本文研究偏好优化如何塑造LLM咨询师在动机性访谈中的行为,发现惩罚对抗行为会以目标坚持为代价换取关系协调,而不是教会平衡的“顺应阻力”技能。
MIThinker提出了一种轻量级推理模型,用于动机性访谈咨询代理,通过监督微调和强化学习训练生成治疗性思考,在较低计算量下实现了与最先进系统相当的MI能力。