我如何在四天内用Opus 5.5构建一个iPhone应用

Lobsters Hottest 新闻

摘要

一位开发者仅用四天时间就使用Anthropic的Claude Opus 5.5 AI模型构建了一个功能齐全的iPhone应用,展示了AI辅助下的快速原型设计,并详细介绍了相关的规划和技术决策。

<p><a href="https://lobste.rs/s/ggolae/how_i_built_iphone_app_four_days_with_opus_5">评论</a></p>
查看原文
查看缓存全文

缓存时间: 2026/09/29 20:04

# 我用 Anthropic 的前沿模型,四天打造了一款 iPhone 应用 来源:https://projectautonomy.substack.com/p/i-built-an-iphone-app-in-four-days 一部 iPhone 屏幕上显示着一个转售应用的商品网格:二手服饰和 Xbox 手柄,每件都标有预估转售价,部分标注“已购”并显示成本和利润。橙色虚线框标出了视图切换按钮、商品卡片和标签栏。左侧文字为“使用 Opus 5.5 制作应用”,背景是柔和的桃粉与淡紫渐变色。(https://substackcdn.com/image/fetch/$s_!5gvc!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F837a847a-2bb3-4402-97be-39965a7d9ad7_1800x1200.png) 我最近用 Claude Opus 5.5——最新的前沿模型——在四天内构建了一个可用的 iPhone 应用。这款应用是为我女友的转售业务设计的:它能识别照片中的商品,并根据 eBay、Mercari 等平台的近期上架信息,估算其转售价值。 前沿模型每隔几个月就变得更强且更便宜。Opus 5.5(https://www.anthropic.com/claude-opus-5-5)性能优于 Fable 5.1,且价格更低(https://venturebeat.com/technology/anthropic-releases-claude-opus-5-5-beating-fable-5-1-on-key-agentic-benchmarks-at-60-cheaper-api-price),而像 GLM-5.3(https://huggingface.co/zai-org/GLM-5.3)和 DeepSeek v4.1 Flash(http://www.deepseek.com/en/news/deepseek-v4-1-flash/)这样的开源模型也带来了持续压力。但基准测试只能说明部分问题。以下是使用 Opus 5.5 构建应用的实际体验,包括它设计的一个令人印象深刻的 4 美元测试,该测试将应用准确率从约 80% 提升至 99%。 我首先与 Claude 进行了两个小时的规划会议。我开场长篇阐述了对应用的构想,并在关键节点让 Claude 将我们达成共识的内容写入计划文档并保持条理。我们逐一敲定所有重大决策,从基本用户流程开始,逐步深入到技术层面,比如依赖哪些服务以及如何控制运行成本。 这份计划文档就是我交给 Claude Code 构建的依据。计划确保智能体按照你的规则和需求工作,而非自行其是。当 Claude 将独立任务分配给子智能体时,这也很有帮助:每个子智能体都能将其工作与总体规划进行对照。 以下是计划的主要内容: - 核心理念:应用的功能与目标用户。 - 用户流程:用户从打开应用开始的完整操作路径。 - 设计考量:我期望应用的外观、手感和工作方式。 - 技术决策:作为软件工程师,我对构建方式有自己看法,但尽量避免在此过多纠结。主要决策是选择哪些第三方服务。最好由你来决定资金支出,而非让智能体决定。 最终,我选择了 Expo + React Native 构建应用,使用 Supabase 作为后端和数据库。我还集成了 Google Gemini 和 Jev 等 API 来实现 AI 功能。但这不仅仅是一个 AI 封装器,它仍是 99% 的定制应用逻辑。 Supabase 与智能体协作良好,因为它将复杂行为抽象为易于理解的系统。由于 Supabase 设定了规则,智能体在配置、迁移和架构方面出错率大大降低。它的成本也足够低,我愿意让智能体用它进行测试。免费套餐非常慷慨,足够我使用到应用开发完成。 计划制定完毕后,我将其交给自动模式下的 Claude Code,并指令:“按计划构建这个应用。等我回来时,我应该能毫无问题地使用它。”有时我只是随便说说,认为这会有帮助。实际上我并不确定是否真的起了作用。 大约两小时后,8000 行代码生成完毕,我女友梦寐以求的应用已经建好并可以使用了。它看起来几乎和我语音描述中的一模一样。我只提到了结构和组织方式,未涉及主题或风格,但它采用了我喜爱的标准苹果风格。一些复杂界面看起来略有偏差,但这可以留到后续迭代解决。 接下来需要测试。我将其安装到 iPhone 上,开始拍摄物品照片以检验识别能力。大部分情况下它能识别,但匹配功能尚未优化。它会调出相似商品而非完全相同商品,且结果不一致,导致价格估算不准。不过,考虑到这省去了三到六个月的兼职编码工作,我丝毫不感到失望。 早期结果让我如此兴奋,以至于我给 Claude 发送了这条信息: > 它成功了,而且太惊人了,Claude。说真的,在我让你参与过的所有项目中,这是最令人印象深刻的。它看起来像一个 iOS 应用。功能完美。构建质量很高,首次运行无需任何修改。你超越了自己,Claude。为自己点个赞吧。 其实它功能并不完美。我只是太兴奋了。我通常不会将模型拟人化,但这个模型值得如此。 卡通沙漠场景。一条崎岖不平的土路通向地平线,然后突然与一条光滑的铺装道路相接,接缝处十分明显。黄色菱形路牌上写着“AI水文内容到此结束”。前景是简朴的仙人掌,而远处则是细节丰富的仙人掌、台地和山脉。(https://substackcdn.com/image/fetch/$s_!BFVz!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fe41222b4-14ae-4dad-9de3-86508c1155e9_1600x900.png)由 Claude 生成,讽刺的是,我不得不进行约 6 次迭代才得到想要的结果。 如果你乐意充当 AI 的肉身容器,看到这里即可。但智能体给出的第一个版本只是草稿,精炼它才是注入人性化元素的关键。 我开始录音,逐一审视整个应用,描述所见内容和期望效果。我谨慎措辞,因为录音会被转录为文字,必须让智能体理解。我涵盖了约 10 个问题:布局调整、交互行为、关键操作的动画与音效,以及挑剔用户可能提出的普遍抱怨。 我将这段 5 分钟的录音直接发送给智能体,它用电脑上的工具转录后,询问了几个问题便开始工作。大约一个半小时后,我得到了一个好得多的应用。它终于呈现出我想要的样子,新功能也按我描述的方式运行。 但算法仍有问题,直到我带着应用实际使用时才完全理解问题所在。我又录制了一段说明,解释哪里出错、我注意到了什么,以及问题发生时正在查看的具体数据。 智能体利用我的示例,在数据库中找到确切的错误结果,并追踪算法出错的环节。由于修复需要对应用核心进行大幅改动,我让它先制定计划。我审阅了它提出的所有方案,然后批准执行。它工作了近两小时,进行修改并自行测试应用以检验结果是否改善。 接着,我让智能体构建了自己的基准测试:33 张我拍摄的真实照片,通过搜索来衡量结果质量。这比任何其他方法都更有效。准确率从约 80% 提升到 99%,遗漏结果从约 19% 降至 1%。33 张照片只是个小测试集,我将其视为积极信号而非确凿证明。整个测试耗费约 4 美元 API 调用费。 我仍在实际使用中寻找薄弱环节,并将它们反馈给智能体。这种“使用→发现问题→清晰描述”的迭代循环是目前大部分工作所在。我会告诉所有使用这类模型构建应用的人不要跳过这一步。 通过这种迭代过程,我在首次构建后添加了以下功能: - 已扫描商品的网格视图和列表视图。 - 快速筛选按钮,用于查看精确匹配、相似匹配或无匹配的商品。 - 结果页面的“喜欢”和“不喜欢”按钮,以便随着时间和测试改进搜索算法。 - 精简商品详情(AI 喜欢重复信息且喋喋不休;剪裁和重塑对此大有裨益)。 堆叠面积图:五天内新增 14,771 行代码,主要是应用和后端代码,从第一天的高峰逐步增长。(https://substackcdn.com/image/fetch/$s_!xXE3!,f_auto,q_auto:good,fl_progressive:steep/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2Fef7637ef-662c-440b-86ed-91b7cb1a0106_3200x2020.png) 这款应用始于规划会议中的一番畅想。四天后它已装入我的手机,并且每次我带着它实际使用都会变得更好。 首个版本让我激动不已,但当前版本完全按照我的设想运行。在我离开办公桌时,模型可以编写 20,000 行代码,但它无法知晓应用应该成为什么样子。因此,测试应用并思考他人使用时的感受,就是我的职责所在。 刻意设计,正是新时代的标志。 需注意的是:如果没有一些编码经验,我不建议以这种方式构建应用。直接使用 Claude Code(https://claude.ai/referral/6MVV3GDJ5Q,限时免费试用码)和 Git 仓库会带来很多潜在问题。如果你非技术背景,Lovable (https://lovable.dev/invite/F2DKZDC)、Replit (https://replit.com/refer/fivemoreminix) 和 Base44 (https://app.base44.com/register?ref=XUYPWAYDPFYL1SLU&source=referral_program)(推荐码)是更好的起点。它们为智能体提供专属指令,为你选择一套标准工具,并提供带有“一键运行”按钮的真实界面。使用 Claude Code 时,你需要自行搭建所有环境,但它成本更低,且你掌控一切。 如果你想看看我接下来的作品,请订阅。在探索过程中,我会持续记录这些模型能做与不能做之事。

相似文章

五天前,我从未构建过Reddit应用

Reddit r/openclaw

一位开发者讲述了如何在五天内利用AI从零构建一个Reddit应用,认为AI的主要价值在于降低从想法到原型的门槛,奖励好奇心而非技术专长。

我把我的真iPhone交给了我的智能体..

Reddit r/openclaw

一位开发者创建了一种方法,让AI智能体通过API控制真实iPhone,实现起草iMessage、运行iOS快捷指令和移动应用测试等任务。他们提供了70部手机供实验使用。