标签
本文研究了在消费级硬件限制下,结构化合成推理数据是否能提升小型语言模型的算术推理能力。使用基于GSM8K的合成语料库,通过LoRA对Qwen3-0.6B和Qwen3-1.7B进行微调,精确匹配准确率提升了12-13个百分点,并在相关基准测试中表现出较强的迁移能力。
本文研究了LLM中的算术启发神经元在符号算术、自然语言文字题和Python代码中是否具有形式不变性。通过激活修补,他们发现了一个共享的神经元回路,该回路对于算术计算是必要且充分的,并且跨格式失败源于激活状态而非不同的回路。
本文发现了一种‘位置复制’捷径:小型语言模型通过复制答案分隔符前的最后一个数字来回答算术问题,绕过了实际推理。该效应解释了为何打乱CoT步骤仍能保持性能;在GSM8K上,它占1-3B模型教师强制准确率的89-92%。