对2023年初的模型在两个指令遵循数据集上进行微调后效果变得很好

Reddit r/LocalLLaMA 模型

摘要

一个在550步内对两个指令遵循数据集进行微调的Pythia-6.9B模型,具备了13种语言的能力,相比基础模型有显著提升。

嗯,我微调了Pythia-6.9B,花了550步进行指令遵循训练,效果变好了。原始基础模型不懂非英语语言。它懂一点,但……微调后的模型掌握了13种语言!即使存在循环,模型也表现良好。[https://huggingface.co/Tralalabs/Pythia-6.9B-Instruct-v1-Merged](https://huggingface.co/Tralalabs/Pythia-6.9B-Instruct-v1-Merged)
查看原文

相似文章

@dair_ai: 值得一读的新论文。GPT-5.4 nano 加上 critic-comparator 编排循环在 SWE-bench Verified 上达到 76.4%,匹配…

X AI KOLs Following

一篇新论文表明,使用一个弱模型,通过 k=8 个提议和 critic-comparator 选择循环,可以在 SWE-bench Verified 上匹配前沿模型的性能,达到 76.4% 的准确率。关键见解是,正确的补丁通常已经存在于弱模型的前 k 个候选补丁中,挑战在于如何利用执行验证进行有效选择。

@ying11231:在TPU上令人印象深刻的性能。

X AI KOLs Timeline

LMSYS Org 的一篇博客文章详细介绍了使用 SGLang-JAX 在 TPU v7x 上优化 Ling-2.6-1T(一个 1 万亿参数的混合 MoE 模型),通过单个 Pallas 内核将 MoE 数据移动隐藏在计算之后,从而实现高效的推理。