标签
一次仅花费500美元的RL微调,使9B开源模型在目录审核质量上达到87%,每1000条列表成本仅0.50美元,显著优于GPT-4和Claude等前沿模型(成本19-172美元,质量仅70-76%)。