@kunchenguid: grok 4.7 第一天观察:忽略那些称其糟糕的报告,他们仅引用公开基准…

X AI KOLs Following 模型

摘要

用户分享了Grok 4.7第一天的观察,强调其对系统提示的严格遵守、稳定性和保守行为,同时指出其比前代版本更慢且成本更高。

grok 4.7 第一天观察 忽略那些说“它很糟糕”的报告,他们唯一引用的是一个公开基准。同样的基准曾告诉我们 opus 5 比 fable 更好——这些基准毫无用处 也忽略那些将模型与3D游戏比较的报告——那不是实际工作。那只是为了社交媒体上的关注 我全天使用 grok 4.7 作为我的 firstmate,它确实是一个非常可靠的模型,相较于 4.5 有明显改进(我忽略了 4.6,因为根据我的经验,4.5 表现更好) 与 4.7 的关键区别 - 1. 它非常、非常紧密地遵循系统提示 我注意到 firstmate 展示了许多以前从未见过的新行为,例如要求我命名具体可以绕过的红色 CI 检查,并拒绝简单的“yolo”指令 我追溯了一下,这确实是在 firstmate 的系统提示中我如何指导它的,但其他模型都没有足够紧密地遵循,以至于这种行为不明显——grok 4.7 是第一个捕捉到这一点的 还有其他几个类似例子。所以对我来说,这是一个明显的行为差异 2. 它非常“稳定” 如果你使用过 astra,你就知道什么是“尖峰”模型。它可能有一些天才时刻,但你偶尔也会疑惑“它怎么会这么笨,不理解我”。grok 4.7 则相反 到目前为止的一整天,老实说,我还没有遇到“哇,这绝对是天才”的时刻,但 grok 4.7 一直非常稳定,没有大的意外。它的行为感觉可预测,这确实帮助我很快地信任了它 3. 它是一个保守的模型 它不喜欢在没有询问的情况下采取行动,并会明确说明 这有点像一把双刃剑,因为这意味着我有时必须明确说明“是的,我确实想要那个”,但事后看来,很多情况确实有点模糊,我可能不希望模型在没有我确认的情况下就直接进行 4. 它比 4.5 稍慢且成本更高,显而易见 轮次花费时间稍长,我的配额消耗速度明显更快。我还没有量化具体原因 所以总体来说,我认为它展示了一些明显不同的特性,我大部分都喜欢这些变化。我会继续将其作为我的主要 firstmate 并进一步观察 如果你一直在使用它,从实际使用中你收集到了哪些质性见解?
查看原文
查看缓存全文

缓存时间: 2026/09/22 15:56

Grok 4.7 第一天使用观察

请忽略那些声称“它很糟糕“且仅引用公开基准测试的报告——那些基准测试曾告诉我们Opus 5比Fable更优秀,它们毫无价值。

同时请忽略那些用3D游戏来比较模型的报告——那不是实际工作,只是为了社交媒体博取关注。

我使用Grok 4.7整整一天作为主力助手,它确实是一个非常稳健的模型,相比4.5版本有明显提升(我忽略4.6版本,因为根据我的经验4.5表现更好)。

与4.7的关键差异——

  1. 它对系统提示的遵循程度非常、非常严格 我发现助手呈现出许多前所未有的新行为,例如会询问我可以接受绕过哪些特定的红色CI检查,并明确拒绝简单的“直接执行“指令。经追溯,这确实符合我在助手系统提示中的指令设置,但此前没有任何其他模型能足够严格遵循以使这种行为显现——Grok 4.7是首个做到这点的模型。还有其他类似案例,因此我认为这是明确的行为差异。

  2. 它非常“稳定“ 如果您使用过astra模型,就知道什么是“波动型“模型。它可能有灵光乍现的时刻,但您偶尔也会困惑“为什么它这么蠢还不理解我“。Grok 4.7恰恰相反。说实话到目前为止的使用中,我还没有遇到“哇这简直天才“的瞬间,但Grok 4.7始终保持稳定,没有大的意外。它的行为具有可预测性,这确实帮助我快速建立起信任。

  3. 它是一个保守型模型 它不喜欢未经询问就采取行动,并会明确说明这一点。这有点像双刃剑——意味着我有时需要明确表示“是的我确实需要这个“,但事后回想,很多情况确实存在模糊性,我可能并不希望模型未经我确认就直接行动。

  4. 它比4.5版本稍慢且成本更高,这是明显可见的 单次交互耗时更长,我的配额消耗速度也明显更快。我尚未具体量化这些差异的来源。

总体而言,我认为它展现出一些明确不同的特征,而且我基本喜欢这些改变。我将继续将其作为主力助手并持续观察。

如果您正在使用它,目前从实际使用中获得了哪些定性洞察?

相似文章

Grok 4.7 初印象

Reddit r/singularity

本文分享了用户对 AI 模型 Grok 4.7 的初步印象,讨论了前端和后端工作,与其他模型如 5.6 sol 和 fable 5.1 的比较,并提出了关于安全措施和审查的问题。