@FradSer: 目前为止做的最有意思的事情: 尝试一系列的方法,让类似 gpt-oss:20b 和 gemma4:e4b 的模型能够在某些条件下接近 Opus 4.7 的水平
摘要
尝试通过一系列方法使gpt-oss:20b和gemma4:e4b等模型在某些条件下接近Opus 4.7的性能水平。
目前为止做的最有意思的事情:
尝试一系列的方法,让类似 gpt-oss:20b 和 gemma4:e4b 的模型能够在某些条件下接近 Opus 4.7 的水平👀 https://t.co/1YUmoZ8dao
查看缓存全文
缓存时间: 2026/05/24 02:18
目前为止做的最有意思的事情:
尝试一系列的方法,让类似 gpt-oss:20b 和 gemma4:e4b 的模型能够在某些条件下接近 Opus 4.7 的水平👀 https://t.co/1YUmoZ8dao
相似文章
@FuckAnthropic: 做了对比分析,综合看,DeepSeek V4 Flash-0731 大致是一个 Opus 4.7 - 4.8 之间水平的模型,以极小激活规模进入了前沿 Agent 模型竞争区间,用约 1/12~1/60 的 token 成本进入前沿 Ag…
作者对比分析认为,DeepSeek V4 Flash-0731 在极小激活规模下达到 Opus 4.7-4.8 水平,以极低 token 成本进入前沿 Agent 模型区间,整体超越 GLM-5.2,但短板仍是困难仓库级编程和长时程工程。
Gemma 4 31B 的能力让我惊讶
一位用户分享了轶事发现:Gemma 4 31B 在理解和重构杂乱的学术代码方面优于 Qwen 3.6 模型,并与 Opus 4.7 能力相当,还突出了一个 Gemma 擅长的基准测试(SciCode)。
@RealYDT: 卧槽,兄弟们,我突然有个有点阴谋论、但越想越合理的猜测: 也许 Opus 4.6,才是 Anthropic 内部最后一代被人类员工大量真实使用的 Opus。 再往后,内部主力已经换成 Mythos。 然后 4.7、4.8、5 的训练和 R…
用户推测从Opus 4.6开始,Anthropic内部已转向使用Mythos模型,导致后续Opus模型训练和行为更加谨慎和AI化。
开源模型正以约1.5倍于前沿模型的速度缩小与GPT/Claude/Gemini的编码差距,且在去污染基准测试中,一个27B模型已经击败了Claude Opus 4.8 [实时仪表盘 + 分析]
一个实时仪表盘和统计分析显示,开源编码模型正以1.5倍的速度缩小与闭源模型的差距,一个27B模型已经在去污染基准测试中超越了Claude Opus。工具调用可靠性仍然是主要瓶颈。
@Xudong07452910: Sai 在 OSWorld 2.0 上以约 2/3 的成本打赢 Opus 5 和 GPT-5.6(73%),复杂桌面任务也能自己点、自己填,已经算一个真正意义上能替你干活的 AI 电脑同事,还是蛮值得一试的。
Sai 在 OSWorld 2.0 基准测试中以约三分之二的成本击败 Opus 5 和 GPT-5.6,得分 73%,展示了高效桌面任务执行能力。