@no_stp_on_snek: Grok 4.5 评测 - 我本周的令牌用完了。编写了一个名为“Hermes Go”的免费iOS/Android应用。正在提交到…
摘要
一位用户评测了Grok 4.5的代理式编码能力,详细描述了如何在32小时的会话中,通过104个提示词,最终生成了一个功能完整的Flutter应用(Hermes Go),包含33k行代码。该模型自主逆向工程了API,并根据反馈进行迭代。
查看缓存全文
缓存时间: 2026/07/11 13:29
Grok 4.5 评测——我这周的配额用完了。写了个免费的 iOS/Android 应用,叫“Hermes Go”。今天提交到 App Store 审核,等我有空再上 Play Store。
我跑了大约 32 小时的 Grok 4.5 会话,它直接给我构建了一个完整的生产级 Flutter 应用。然后我翻了一遍本地会话日志,看看实际发生了什么。这些数字有点不真实。
成果:“Hermes Go”,一个完整的 iOS 网关客户端,对接 @NousResearch 的 Hermes Agent。51 个文件,33,000 行 Dart 代码。支持 WebSocket 实时同步、离线优先缓存、斜杠命令与技能自动补全、消息编辑/重试/中断、主题、触觉反馈、语音听写、7 种语言本地化、App Store 素材。从空目录开始。
规模:我发了 104 条提示词,转化成了 880 个自主智能体循环、2,066 次工具调用,以及通过 739 次编辑写下的约 20,000 行代码。也就是说,我每打字一条提示词,它大约产出 190 行可交付代码。
没人提到的一点:它读取的代码量是写入的两倍——919 次读取和 grep 调用对应 682 次编辑。它没有胡诌一个网关 API,而是直接去研究了 Hermes 桌面应用的源码,反向工程出真实的接口。当我告诉它“别搞‘大概’,去查日志”,它照做了。
而我在这整个过程中实际扮演的角色:一个拿着手机的产品经理。我截了图发过去,说了诸如“那个 logo 看起来好丑”“麦克风按钮位置低了”之类的话,然后它就开始迭代。构建、推到我的实体 iPhone、我验收、重复。大约 4 小时的模型计算分散在 32 小时的我用真机测试的时间中。
它好几次撑爆了上下文窗口——至少可以说是这样——然后压缩了,继续推进,没有丢掉主线。
现在,在 Grok 上跑长周期自主编码是可行的,就在我的笔记本电脑上运行,而且它在我挑剔字体的时候就能交付应用。
干得好,@SpaceXAI 团队!
现在就等苹果那边通过审核了。
相似文章
@elonmusk: Grok 4.5 的好评
埃隆·马斯克发推文分享了一个对 Grok 4.5 的正面评价的链接。
@PrajwalTomar_:我只给了Grok 4.5一句话,它就在我喝完咖啡之前给我构建了一个能用的应用。Cursor刚刚推出了一项仅限...
Grok 4.5,一个强大的编码模型,现已纳入Cursor新推出的印度专属计划,每月₹649,让开发者仅凭一句话就能利用云端代理构建完整应用。
Grok 4.6 – A field guide (8 minute read)
A hands-on field guide to Grok 4.6, highlighting its speed, dense communication style, and effective prompting patterns for coding and knowledge work.
@elonmusk: Grok
埃隆·马斯克分享了一个工作流程,使用Grok 4.5进行各项开发任务,同时还有Fable 5和GPT-5.6 Sol,强调了一个实时研究和编码设置。
@RoundtableSpace: 一位开发者在发布15天后将Grok Bot 0.18重构为可读的TypeScript,并将其转化为一个shell,该shell r…
一位开发者将Grok Bot 0.18重构为可读的TypeScript,并创建了一个shell,该shell通过Claude Code和Codex等AI工具路由任务,支持本地执行和插件。