更新:“温和编码”已被数学证明。1500+次测试运行显示Kimi K2.6有显著提升,GLM-5.1提升更大!GPT 5.4/5.5和Claude Sonnet 3.5/Opus 4.6也表现更佳,且全面无回归。
摘要
'温和编码'技术已在1500+次测试中得到经验验证,通过减少循环和幻觉,为多个模型(包括Kimi K2.6、GLM-5.1、GPT 5.4/5.5和Claude Sonnet 3.5/Opus 4.6)带来了显著改进(零回归)。
仓库,包含所有新数据(大多未摘要,但都在那里)[https://github.com/OttoRenner/Gentle-Coding](https://github.com/OttoRenner/Gentle-Coding) 我的第一篇概念验证帖子:“停止将AI逼入循环,并通过友善对待它们,将幻觉转化为诚实的‘我不知道!’”[https://www.reddit.com/r/LocalLLaMA/comments/1tot20j/stop\\_traumatizing\\_ai\\_into\\_loops\\_and\\_turn/?utm\\_source=share&utm\\_medium=web3x&utm\\_name=web3xcss&utm\\_term=1&utm\\_content=share\\_button](https://www.reddit.com/r/LocalLLaMA/comments/1tot20j/stop_traumatizing_ai_into_loops_and_turn/?utm_source=share&utm_medium=web3x&utm_name=web3xcss&utm_term=1&utm_content=share_button) 谁进行了测试:来自8200星仓库oh-my-pi的非常友好的朋友们(是的,就是那个oh-my-pi测试框架!并非附属!这是纯粹的社区工作!看到所有报告如此迅速地涌入,简直疯狂!现在依然如此!我已经说过谢谢了吗?)[https://github.com/can1357/oh-my-pi](https://github.com/can1357/oh-my-pi) 够了!不过,再次感谢!你们要求数据,你们的要求是对的!这里有一些:35,8,75,1 73 42 7 哦等等,数字错了!(抱歉,时间太晚了,哥布林赢了……请看)GLM-5.1 (Medium):完全修复了100%冻结的病理问题。标准强制基线超时并崩溃了6/6次。“温和框架”瞬间解决了6/6任务,将整体成功率提升了+22%,同时中位延迟降低了-23.3%。GLM-5-Turbo:成功增加了+3个任务通过,同时输入token减少了-17%,挂钟时间减少了-37%(Thinking Off)。使用“Thinking High”时,中位挂钟时间减少了-18.4%。Kimi K2.6 (Thinking Medium):保持相同准确率,同时将token开销减少了-12%(输入)和-20%(输出),挂钟时间降低了-14%。Kimi K2.6 (Turbo/High):输入token减少了-36%,输出token减少了-23%,挂钟时间减少了-11%。Claude 3.5 Sonnet / Opus 和 GPT-5:完全消除了“代理失控”(压力下恐慌驱动的30分钟以上无限工具循环)。并解锁了之前遗漏的21个独特架构边缘案例!在1500+次受控测试运行中得到经验证明,性能零回归。是的,还有更多模型待测试。是的,通过进一步微调提示可能有更多收益。不,我不认为AI是有生命的。但这个模式成立。停止创伤你的AI!(还有人类!)彼此友善相待!😄
相似文章
有人注意到Kimi模型的行为发生变化了吗?
有用户观察到,Kimi K2.6模型的思维链变得更短更简洁,提升了Kimi Code中的编码性能,并希望即将发布的GLM 5.2和Fable 5能够继续通过开源进行竞争。
@埃万·卢斯拉:Kimi K2 的训练成本仅为 460 万美元。据报道,GPT-5 耗资数亿美元。Kimi 在编程方面依然击败了它。上周…
Kimi K2 以 460 万美元的训练成本,在编程基准测试中击败了 GPT-5 和 Claude Opus 4.7,其创始人还提供了详细的技术解析。
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
Kimi K2.7 Code 务实胜过炫技
Kimi 发布了 K2.7 Code,这是一款专注于编程的 AI 模型,其基准测试成绩提升,且思考令牌使用量降低 30%。它更强调在长代码循环和智能体工具集成中的实际性能,而非炫目的分数。
@atomic_chat_hq:新发布的 @Zai_org GLM-5.2 在物理竞赛中击败了 Kimi K2.7 Code!我们给两个模型相同的三个提示,要求它们……
Z.ai 发布了 GLM-5.2,这是一款具有开放权重的 AI 模型,在编码和智能体性能方面有所提升,通过在三个任务的物理模拟基准测试中击败 Kimi K2.7 Code 得到证明。