标签
作者幽默地对比了他对本地GLM 5.3 Flash模型使用的精确提示方式,与他兄弟在编程任务中对GPT-6-Astra的斥责方式,突出了不同的大型语言模型交互风格。
用户分享了使用本地量化(antirez imatrix 量化)和 pi 工具在 SlopCodeBench 上对 DeepSeek V4 Flash 的最新基准测试结果,显示性能较之前运行有所提升,但仍比托管 API 慢。
DeepReinforce发布了Ornith-1.0,这是一个MIT许可的开源智能编码LLM系列,包含一个397B MoE模型,该模型在SWE-Bench和Terminal-Bench上超越了Claude Opus 4.7,采用了新颖的自我改进训练策略。