@PrajwalTomar_: https://x.com/PrajwalTomar_/status/2097302816641761426

X AI KOLs Following 模型

摘要

一位用户分享了他们花费1000美元测试GPT-6 Astra的经验,强调了其自主能力,如自测试和计算机使用,并认为重点应放在其行为成就上,而不是AGI标签上。

https://t.co/1U4UysijC4
查看原文
查看缓存全文

缓存时间: 2026/09/08 19:36

GPT-6 Astra 让我感觉像通用人工智能(我花了1000美元验证)

过去三天,我在GPT-6 Astra上花费了略超1000美元的信用额度。

我用它处理了我广告公司的实际客户项目,用它构建了多人游戏,让它控制我的电脑,甚至亲眼目睹它在无人要求的情况下自动测试自己编写的代码。

我经营着5家AI优先的企业,自GPT-4以来,每个主流模型我都交付过客户项目。如今能让我感到震撼的东西已寥寥无几。

而Astra是第一个让我向后靠在椅子上认真思考的模型。

我的整个时间线都在争论这是否算得上通用人工智能。我认为这是个错误的问题——读完本文你就会明白原因。我将带你详细了解我用它做了什么、花费了多少,以及如果重新开始,我会在第一天做什么。

以下是完整分析。

1000美元花在了哪里

先看实际账单再谈观点——毕竟这周每个宣称通用人工智能的人背后都有商业动机。

→ 构建并完整测试的3D多人射击游戏 → 根据户型图在Blender中建模的公寓3D漫游 → 用约15分钟构建的图像搜索桌面应用 → 包含管理后台的等候名单页面,单次提示即可上线 → 控制电脑处理日常采购、信息研究和表格填写 → 两天通过Astra Low模式处理的客户工作

其中大部分开销发生在一天半内,那时我还没完全掌握这个模型的最佳使用方式。稍后会详细说明,因为最关键的认知突破在于知道什么不该做

错误的问题

关于通用人工智能的争论充斥着基准测试、不断变化的目标和播客哲学。

黄仁勋的发言并未提供帮助。发布次日他发布了这条动态:

黄仁勋@JensenHuang · 9月7日 回复 @ChaseLochmiller 和 @OpenAI GPT-6 Astra 在约10万块以上NVIDIA Grace Blackwell NVLink72集群上训练完成。从ChatGPT到o1再到Astra,历时4年。

通用人工智能已到来。恭喜@OpenAI团队。

接下来将上线40万块GPU。[1.8K 7.4K 41K 11M]

超过1100万次浏览。请注意最后一行:宣布通用人工智能的人同时宣布了新增40万块GPU。这个标签本身就在完成销售任务。

所以请忽略标签。真正重要的问题是行为层面的:这个系统能在无人监督的情况下完成什么?你是否仍需要检查它的工作成果?

我为此测试了三天。以下是五个改变我判断的关键时刻。

1. 无人要求时自动测试工作成果

这是最令我震惊的一点。

当时我正在为射击游戏构建新地图。Astra完成构建后,并没有像往常那样报告“完成“等待确认,而是自动启动了一场对局。它操控角色实际游玩了整个地图,走遍每个角落,发现了一个导致玩家坠入地面的生成点,修复该问题后再次测试,最后才告诉我准备就绪。

我从未在提示词中要求这些。它会截取自己的输出成果,进行评估,然后循环自我提示直到工作通过验证。

后来我添加了新武器,看着它花了近40分钟测试这一项功能,尝试玩家可能破坏平衡的所有方式。

OpenAI官方指南现在提示用户不必再指示它运行测试,因为它已经会自动执行,重复指令反而会导致过度测试。请思考这意味着什么:现在的问题不再是让模型执行测试,而是如何让它停止测试

此前所有模型都交付作业让我审阅,而这个模型直接交出成品。这意味着我们与工具的关系已发生本质变化。

2. 像员工一样操控我的电脑

在参加客户会议时,我让Astra订购一周的常规杂货。它直接在我电脑上打开浏览器,逐项搜索商品,将商品加入购物车,甚至未经指示就切换成更便宜的超市自有品牌。

接着我把整周的枯燥任务都交给了它:填写供应商表格、为客户做竞品研究、将数据整理到文档。所有这些都在我的屏幕、用我的登录账户完成。

这种突破有其原因:据报道OpenAI采购了数万台Mac Mini,专门用于通过强化学习训练计算机操控智能体。现在,计算机操控已成为核心产品,效果显而易见。

关键思维转变:凡是电脑上不享受重复的工作,现在都可以委托执行。我维护着一个“绝不手动重复“的清单,这周清单内容翻了一番。

3. 3D建模不再是专业技能

我从未打开过Blender软件。第二天,我向Astra提供公寓户型图,要求生成可漫游的3D版本。

它自主启动Blender,建立房间模型,添加所有材质纹理,自我检查渲染结果,约一小时后就生成了可漫游的文件。接着它将同一模型转换成我游戏里的可玩地图。

这不仅是我个人的体验。本周最热门的演示案例都是3D类:一个交互式人体解剖网站(身体分解为2000多个带标注部件,获得超过600万次浏览),还有浏览器中可逐件拆解的特斯拉模型(同样获得海量关注)。

3D建模曾是职业,本周开始它变成了提示词。现在稀缺的是如何利用无限3D资产的能力:游戏开发、产品演示、客户漫游展示、3D打印等。

4. 我“生成”软件而非购买

有个个人小困扰:为客户演示文档搜集图片,意味着每天要在谷歌图片和幻灯片间切换50次。

我向Codex描述了想要的工具。约15分钟后,我就有了通过快捷键调用的桌面应用:多图搜索、背景去除、自动保存到指定文件夹。去年这类工具需要每月29美元订阅费,现在它完全属于我。

接着我尝试了ChatGPT Sites。由于内置了托管、数据库和身份验证,我为产品搭建了等候名单页面,管理后台仅通过我的邮箱访问。单次提示,即时上线,无需服务器。

我曾为功能更少的工具向开发者支付过真金白银。

5. 它需要更少指令而非更多

这是我将提出的最具争议的观点。

第二天,我将某个内部代码库的agents .md文件精简到近乎空白——这个文件我已完善数月。一切正常运转,执行成本更低速度更快,因为文件中的每条规则都会随提示词加载并消耗token,而Astra根本不会犯那些规则原本要预防的大多数错误。

OpenAI也认同这点。他们的新提示指南专门提供了调试提示词,用于查找与当前模型冲突的旧规则和技能,并建议审核精简agents .md文件而非不断扩充。

我的提示方式也改变了。现在我主要提问:我的认知盲点在哪里?接下来该构建什么?最高杠杆的行动是什么?模型提出方案,我批准执行。甚至在处理任务时,它会主动向我提出澄清性问题,而非预先加载所有信息。当我在任务中途改变主意时,只需告知,它能无缝调整而不丢失已完成的工作。

经济性也指向同一方向:我在Astra Low模式下运行的客户任务,曾需GPT-5.6 Sol High模式才能完成。Low模式表现持平甚至更优,而成本只是其中一部分。这就是我剩余1000美元停止消耗的原因:High模式用于规划和盲点排查,Low模式全天候执行。

当模型需要更少指令、运行成本更低、还会主动询问澄清时,通用人工智能标签就不再感觉像纯粹营销话术了。

今天我会如何开始

→ 获取ChatGPT桌面应用和Codex。计算机操控功能仅在此可用,而这正是当前的核心能力。 → 默认使用Low模式。仅在规划和盲点排查时使用High模式。我最初一天半烧掉500美元正是因为不懂这个。 → 第一天就委托完成一项完整枯燥任务:填表、研究、购物。亲眼见证一次运行,你的认知模型将永久更新。 → 使用OpenAI官方调试提示词审核你的agents .md文件。在修改客户付费项目前,先在某个内部代码库测试精简后的文件。 → 部署一个ChatGPT Site。这是感受全栈能力最快的方式。 → 迁移现有代码库?OpenAI提供了一键命令。在Codex中运行“$openai-docs migrate this project to GPT-6 Astra”,它会将完整官方指南应用到你的项目中。

注意事项

→ 通用人工智能标签也是广告。GPU供应商、模型实验室和内容创作者都从你的信从中获益。请评判行为,忽略宣称——包括我自己的。 → 它会在付费墙和访问权限前止步。Astra能连续处理任务一小时,但无法为你购买未授权的软件,且需要你的账户保持登录状态。 → High模式会无声消耗资金。若全部使用最高配置,三天1000美元很容易用尽。默认使用Low模式不是可选项。 → 尚未验证前勿在客户项目中删除规则文件。我先在内部代码库测试是有原因的。审核、精简、验证,然后再迁移。

这真正意味着什么

通用人工智能的争论将持续一整年。但行为变革已经悄然发生——就在这三天,就在我电脑上。

一个能操控电脑、自我检查成果、并在构建过程中向你提问的模型,与传统聊天机器人是完全不同维度的工具。无论你赋予它什么标签,那些在这个月就围绕它重构工作流程的人,将在其他人争论定义时持续积累优势。

2026年对早期行动的构建者将极不公平。

总结

→ 3天,1000美元信用额度,真实客户项目:Astra是完全不同维度的模型 → 它会自动测试输出成果直至通过验证(包括实际游玩自己构建的游戏) → 计算机操控能力足以接管你整周的枯燥任务 → 3D建模、个人软件、托管应用现在都是提示词,不再是专业技能或薪资支出 → 在我的任务中,Astra Low以更低成本超越GPT-5.6 Sol High:规划用High,执行用Low → 你的规则文件大多已成冗余。OpenAI官方指南建议审核精简 → 忽略通用人工智能争论,评判行为表现,立即行动

冲就完了。

相似文章