对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好
摘要
一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。
嗯,我微调了Pythia-6.9B,花了550步进行指令遵循训练,效果变好了。原始基础模型不懂非英语语言。它懂一点,但……微调后的模型掌握了13种语言!即使存在循环,模型也表现良好。[https://huggingface.co/Tralalabs/Pythia-6.9B-Instruct-v1-Merged](https://huggingface.co/Tralalabs/Pythia-6.9B-Instruct-v1-Merged)
相似文章
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型——结果比预期的要好
在Fable-5编码轨迹上微调了LiquidAI的LFM2.5-230M模型,发现结果比预期的要好。
让小型模型在自身错误中训练:它在HumanEval上达到80%,并在数学上超越GPT-3.5
一位研究人员让小型语言模型在自己生成的编程错误和修正上进行训练,在HumanEval上达到80%,并在数学上超越GPT-3.5,展示了在极少资源下的有效自我改进。
@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…
一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。
@ying11231:在TPU上令人印象深刻的性能。
LMSYS Org 的一篇博客文章详细介绍了使用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(一个 1 万亿参数的混合 MoE 模型),通过单个 Pallas 内核将 MoE 数据移动隐藏在计算之后,从而实现高效的推理。
我训练了1B模型遵循指令,结果它更不听话了...
作者用相同的SFT方法训练了1B、2B和3B模型,观察到1B和2B模型的指令遵循能力(IFEval)退步了,而3B模型却提升了,这可能与学习率或模型容量不同有关。