微调 Cactus Needle 2 可在特定任务上匹配 DeepSeek v4
摘要
Cactus Compute 展示了通过在特定任务上微调其 Needle 2 模型,可以超越 DeepSeek v4 Flash,强调了避免基准测试过拟合的重要性,并提供了用户定制工具。
嘿 LocalLlama,我是 Cactus 的 Henry!在训练 Needle 2 时,我严格规定不向模型暴露任何感觉像这些基准测试的数据样本。这看似过度,但基准测试容易过拟合,而在实际使用中效果不佳,尤其是因为我们量化到 2-bit。数字可能看起来亮眼,但现实世界的意图匹配会大打折扣。然而,我们开放了一个 Playground:https://cactuscompute.com/needle,供用户找出适合他们的方案,然后使用 Python 库 https://github.com/cactus-compute/needle 进行微调,前提是问题空间受限。微调完全在您的 Mac/PC 上几分钟内完成。为了展示这一点,当我们为每个任务微调后,Needle 2 在这些特定任务上超越了 DeepSeek v4 Flash。当然,通用模型承担着学习广泛语言分布的负担,这些结果必须在这一背景下解读。运行 Needle 2 的产品几乎总是这样做。我们已经看到 Needle 2 被微调用于各种任务,我们很想听听大家对此的看法。请设置良好的评估以避免过拟合。我们正在开发新的 Needle 微调算法,但会稍后推出。请分享保留意见和真诚的批评!
相似文章
DeepSeek v4 Flash 能力显著提升
DeepSeek V4 Flash 在预览更新中展现出显著的基准测试提升,在智能体编码任务上与 GPT-5.6 Terra 互有胜负。
DeepSeek-V4-Flash-0731 在基准测试中现已大幅超越 DeepSeek-V4-Pro-Preview
DeepSeek 的新 V4-Flash-0731 模型在基准测试中的表现现已远远优于 V4-Pro-Preview,标志着该模型系列取得了显著进步。
DeepSeek V4 Pro 在精确度上击败 GPT-5.5 Pro
据报道,DeepSeek V4 Pro 在精确度上优于 GPT-5.5 Pro,这标志着模型准确性方面的重大进步。
DeepSeek v4.1 Flash
DeepSeek 推出了 DeepSeek-V4.1-Flash,这是一款旨在增强能力、提升推理速度、实现原生视觉理解并具备可扩展性的新型 AI 模型,是其最新架构系列的一部分。
我在家运行了(更快的)DeepSeek V4 Pro
用户报告成功使用 ktransformers 在本地运行 DeepSeek V4 Pro 模型,并分享了在不同上下文深度下的详细基准测试结果,展示了改进的推理速度。