@HuggingPapers: LoopCoder-v2 已发布。一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的高分,击败了...
摘要
LoopCoder-v2 是一个基于 18T token 训练的 7B 模型,仅用两次循环就在 SWE-bench Verified 上取得了 64.4 的成绩,性能超越 30 倍参数规模的模型。模型和代码已在 Hugging Face 上开源。
查看缓存全文
缓存时间: 2026/06/17 13:54
LoopCoder-v2 已发布
一个在18T token上训练的7B模型,仅用两个循环就在SWE-bench Verified上取得了64.4分,击败了30倍大的模型。
添加第三个循环反而效果更差。
模型和代码已在Hugging Face上发布。 https://t.co/nyHlt7suMB
相似文章
20B循环模型(论文)以10%的预训练token匹配或超越Qwen3 Coder 30B
Loopie模型采用循环变换器架构,仅用10%的预训练token即可匹配或超越Qwen3 Coder 30B的性能,展现出强大的推理能力和高效的扩展性。
Multilingual-Multimodal-NLP/LoopCoder-V2 · Hugging Face
LoopCoder-V2 是一个基于 Parallel Loop Transformer (PLT) 构建的 7B 参数指令调优代码模型,展示了非单调测试时扩展特性,其中两个循环提供了最佳的收益-成本权衡,并在代码生成和推理基准测试上显著优于基线模型。
@DorothyDDU: LoopCoder-v2 已发布 Loop Transformers 重复使用同一个块进行循环隐藏状态优化——让模型“思考”更多……
本文介绍了LoopCoder-v2,一个70亿参数的并行循环变换器系列,用于代码生成,并研究了最优循环次数,发现两个循环能带来显著提升,而更多循环则会导致性能下降。
@ClementDelangue: Kog 在 @huggingface 上开源了用于展示模型每秒 3000+ tokens 速度的 2B 模型。非常……
Kog 开源了 Laneformer 2B 模型,这是一个 23 亿参数、经过指令调优的编码模型,专为高速解码设计。通过从架构阶段优先考虑延迟,实现了每秒超过 3000 个 token 的生成速度。
@rohanpaul_ai: 这篇论文提出了一个大胆的主张,对‘更多测试时计算应持续带来帮助’的普遍观点提出了挑战。声称一个代码…
本文介绍了 LoopCoder-v2,一个 7B 代码模型,该模型从单次重新思考循环中获益最大;额外的循环会降低性能,挑战了‘更多测试时计算总是有帮助’的假设。