@kunchenguid: grok 4.7 第一天观察:忽略那些称其糟糕的报告,他们仅引用公开基准…
摘要
用户分享了Grok 4.7第一天的观察,强调其对系统提示的严格遵守、稳定性和保守行为,同时指出其比前代版本更慢且成本更高。
查看缓存全文
缓存时间: 2026/09/22 15:56
Grok 4.7 第一天使用观察
请忽略那些声称“它很糟糕“且仅引用公开基准测试的报告——那些基准测试曾告诉我们Opus 5比Fable更优秀,它们毫无价值。
同时请忽略那些用3D游戏来比较模型的报告——那不是实际工作,只是为了社交媒体博取关注。
我使用Grok 4.7整整一天作为主力助手,它确实是一个非常稳健的模型,相比4.5版本有明显提升(我忽略4.6版本,因为根据我的经验4.5表现更好)。
与4.7的关键差异——
-
它对系统提示的遵循程度非常、非常严格 我发现助手呈现出许多前所未有的新行为,例如会询问我可以接受绕过哪些特定的红色CI检查,并明确拒绝简单的“直接执行“指令。经追溯,这确实符合我在助手系统提示中的指令设置,但此前没有任何其他模型能足够严格遵循以使这种行为显现——Grok 4.7是首个做到这点的模型。还有其他类似案例,因此我认为这是明确的行为差异。
-
它非常“稳定“ 如果您使用过astra模型,就知道什么是“波动型“模型。它可能有灵光乍现的时刻,但您偶尔也会困惑“为什么它这么蠢还不理解我“。Grok 4.7恰恰相反。说实话到目前为止的使用中,我还没有遇到“哇这简直天才“的瞬间,但Grok 4.7始终保持稳定,没有大的意外。它的行为具有可预测性,这确实帮助我快速建立起信任。
-
它是一个保守型模型 它不喜欢未经询问就采取行动,并会明确说明这一点。这有点像双刃剑——意味着我有时需要明确表示“是的我确实需要这个“,但事后回想,很多情况确实存在模糊性,我可能并不希望模型未经我确认就直接行动。
-
它比4.5版本稍慢且成本更高,这是明显可见的 单次交互耗时更长,我的配额消耗速度也明显更快。我尚未具体量化这些差异的来源。
总体而言,我认为它展现出一些明确不同的特征,而且我基本喜欢这些改变。我将继续将其作为主力助手并持续观察。
如果您正在使用它,目前从实际使用中获得了哪些定性洞察?
相似文章
@corbin_braun: 我花了50小时使用 Grok 4.7(以下是它的最佳用例)
一位用户分享了他们使用 Grok 4.7 50小时的经验,并突出了其最佳用例。
@ericzakariasson: Grok 4.7 已发布,这是我们目前最好的模型!在 Cursor、Grok Build、API 或任何你获取令牌的地方试试看!…
Grok 4.7 作为 Grok 4.6 的改进版本发布,在相同价格和速度下提供更好的性能,并且可以通过各种平台访问。
Grok 4.7 初印象
本文分享了用户对 AI 模型 Grok 4.7 的初步印象,讨论了前端和后端工作,与其他模型如 5.6 sol 和 fable 5.1 的比较,并提出了关于安全措施和审查的问题。
@stanine: 嗯。今天我们用Grok 4.6跑了2100次评分测试。和4.5相比,通过率从87.3%退步到85.9%,并且nea…
本文报告了Grok 4.6相对于4.5的性能退化,通过率降低且延迟增加,对实际业务任务产生了影响。
@ericzakariasson: 你目前对 Grok 4.6 怎么看?Grok 4.7 有哪些可以改进的地方?
用户正在征求对 Grok 4.6 的反馈,并询问对 Grok 4.7 的改进建议,这表明讨论是关于一个AI模型版本的。