PrajwalTomar_ 的推文:https://x.com/PrajwalTomar_/status/2100926059218870580

X AI KOLs Following 新闻

摘要

本文介绍了使用 GPT-6 Astra 作为 AI 导演和 Higgsfield 作为渲染工作室来创建动态图形的工作流程,详细说明了步骤、成本以及与传统代理机构的比较。

https://t.co/AazgLZkClb
查看原文
查看缓存全文

缓存时间: 2026/09/18 14:39

如何将GPT-6 Astra变身为动态图形工作室(完整课程)

GPT-6 Astra上线两周,至今仍是信息流里的绝对主角。两天前我写过它如何通过真实网站重塑网页设计。今天我想测试的,是我十年前就曾涉足的领域。

动态图形。

Astra本身无法生成视频——它没有渲染引擎。但只要给它一个工作室来执导,它便能规划、分析参考素材、撰写分镜表,其指导水平甚至超过我曾雇佣过的大多数专业人士。成品质量已远非一年前可比。

以下是本文要点:

  • 为何沉寂十年后重返动态图形领域
  • GPT-6 Astra在此工作流中的真实能力边界
  • 我的首次尝试及其与千篇一律AI广告的相似之处
  • 我为客户制定的「工作室循环」五步工作法
  • 我坚守的六项原则
  • 实际消耗的积分成本 vs 代理商报价
  • 免费版本、局限性及构建清单

十年后为何重返动态图形

动态图形是我最初的狂热所在。约十年前,我常在After Effects里熬夜制作无人要求的LOGO动画和动态字体。后来软件工程学位变得繁忙,接着是创办代理商、应用工作室,这项技能便逐渐搁置。

上周,一位咨询客户将其重新带回我的生活。他经营AI代发货商店及其他几家企业,告诉我每月需向代理商支付数千美元制作动态图形:产品广告、发布短片、在Instagram和Meta平台投放的15秒短视频。每个简报需要两周,每次修改都意味着新的账单。

他询问AI是否已能胜任这项工作。一个月前我坦诚的回答会是「否」。

两个视频改变了这一点。Higgsfield团队于9月2日发布视频,拆解六种动态设计风格及其企业报价——15秒发布视频最低端价格从500到3000美元不等,全部通过Claude与Higgsfield MCP完成(可在此观看)。9月14日,Matteo AI发布视频展示了使用ChatGPT内GPT-6 Astra实现相同流程的方法,下方工作流正源于他的演示(可在此观看)。在此特别感谢两位先行者——创意属于他们,而我的实践、客户项目及围绕其构建的循环流程则源于此。

观看两个视频后,我意识到这正是客户所付费的内容,当晚便用他销售的产品类别开始了尝试。

GPT-6 Astra的实际能力与局限

理解关键的心智模型很简单:Astra是导演,Higgsfield是制片厂

导演从不触碰摄影机。它观察参考素材,逐帧分解,撰写分镜表,检查分镜脚本,提供拍摄意见并挑选最终成片。Higgsfield则专司一项职责:渲染。它拥有视频模型和预设,Astra可通过插件直接在对话中调用它们。

我读过的所有「AI无法制作动态图形」的论调,皆源于某人单独尝试了其中某个工具。

连接它们仅需一分钟:在ChatGPT进入插件商店,搜索Higgsfield,连接并授权。接着我提出一个问题以探查可用资源:

“你已连接Higgsfield。请列出可调用的视频模型与预设,并说明哪款适合高端产品广告。”

它反馈了完整的制片厂配置:Veo 3.1、Seedance 2.5、Kling 3.0、MiniMax Hailuo、Wan 3.0、Grok Video、FLUX 3 Video,外加营销工作室、动态转场及广告乘数工具。它统计出87个病毒式预设和649个营销工作室模板,并按名称列出了产品预设:光束扫描、微距滑动、产品旋转、推进镜头、液态包裹。

随后它做出了选择(原文直录):

“我的选择:以「光束扫描」开启主产品展示,用「微距滑动」呈现材质特写。若制作完全定制化电影级广告,我会选用 Cinema Studio Video 3.0 并提供产品参考图。”

记住最后一句——它最终证明是正确的,而我第一次尝试时却忽略了它。

关于Higgsfield的说明:本文不含赞助内容。我曾与Higgsfield有过付费合作,自己也付费使用约一年(主要用于图像生成),并向客户推荐。若不愿付费,本文末尾提供了此工作流的免费版本。

我的首次尝试:所有AI广告的缩影

测试选用了哑光黑色便携咖啡机——他店铺热销的典型产品。造型简单,单一配色,表面无需文字。我选定Outin Nano作为真实产品模型,后期为Astra提供了实物照片而非抽象概念。

首次提示词原文:

“制作一款高端、简约、现代的15秒哑光黑便携咖啡机动态图形广告。要求电影感、杂志质感、奢华格调。请生成视频。”

它自主选择了Seedance 2.5,自动生成了请求「电影级照片级3D产品渲染」的Higgsfield提示词,1分5秒后返回包含配乐的15秒竖版视频。

前两秒看似尚可,随后便显现出所有AI工具的通病:

  • 照片级3D渲染:黑色管状物置于黑石之上,聚光灯照射。我要求动态图形,得到的却是产品渲染——因我未明确排除不想要的风格
  • 陈词滥调的文案:「你的日常仪式」「优雅便携」「随处可享浓缩」无人撰写这些句子,它们是万条广告的平均值
  • 千篇一律的节奏:缓慢平移、缓慢旋转、缓慢推进、缓慢拉远。永不切镜,因而永无记忆点
  • 金色衬线字体渐显渐隐于暗色渐变上:这是「高端」一词的默认装扮

这些问题与模型无关。我用形容词描述广告:高端、简约、现代、电影感。这些词对每个人意味着不同事物,模型选择了平均值,而平均值即模板。

这与我此前分析网站问题时犯的错误相同:你无法向模型描述品味,必须指向它。

工作室循环流程

这是我实践后的工作流。五个步骤,前两步直接源自Matteo的视频,分镜技巧来自Higgsfield视频,第三步和第五步是我在代理商经验中添加的实战环节。

第一步:选择单一参考

一条15秒广告,与你要制作的品类相同,将其展示给模型。情绪板在此无效。客户会选择他梦寐以求的那条广告。对咖啡机而言,意味着寻找高端咖啡机广告——纯动态,无人声。

Matteo的第一准则贯穿此步:用展示替代描述。每当你试图输入形容词时,思考能否改为展示实例。

坦白我的过程:我当时没有客户的参考广告,于是测试了真正想验证的内容——将首次尝试的视频作为参考,附上Outin Nano照片,要求Astra像分析陌生广告般分解视频,保留节奏,并将简报重写为动态设计。若仅靠分解步骤就能使成品脱离模板,此循环便有效。你将看到结果。

第二步:分解分析

此步骤被所有人跳过,却是关键所在。暂不生成视频,附上参考素材请Astra记录所见:

“附件为15秒产品广告参考。暂不生成内容。请观察并提供分解:1) 按节拍逐帧标注时间戳;2) 背景、产品重点色与文字的确切十六进制色值;3) 每次镜头运动的名称(推进、环绕、甩镜、定格)及持续时间;4) 字体处理:字重、相对于画面的尺寸、位置、出入场方式;5) 节奏模式(快-慢-快等);6) 用一段文字阐述奢华感来源。随后为我的产品——哑光黑便携咖啡机重写相同分解作为15秒广告简报。保持时间码、镜头运动与节奏完全一致,仅替换产品、色彩与文案。文字应作为纹理存在,无可见文字,仅最后一拍出现产品名称。非照片级实拍,非3D卡通渲染,要求动态设计。”

它首先从视频中抽取六帧并标注时间:1.50、4.50、6.75、8.50、11.00、13.50秒,随后展开分解(原文直录):

“第6拍始于首个可见片尾淡入,约11.875秒。本参考中无甩镜。”

“以下是精确采样解码的RGB值,非可恢复的原始设计色板。视频使用渐变、金属反射与抗锯齿文字,每种材质包含多种颜色。”

开场背景#000000|暖调微距背景#141210|主体背景#090809|铜色产品重点色#C29B7A|主标题#FCD886|辅助文字#E2C096

“重点色为反光铜色,非均匀铜色填充。同理,文字看似暖象牙色,实则包含桃色与奶油色渐变。”

“参考使用高对比度杂志衬线体,细发丝笔画与显著垂直笔触。”

我自己绝不会写下的是节奏细节:它将节拍精度控制在小数点后三位——3.417至6.167秒为微距推镜,6.167至7.375秒为旋转定格,7.375至10.125秒为倾倒镜头。重写简报时,它保留了所有这些时间窗口,节奏不变,视觉语言彻底改变

接着是重写环节,这证明模型理解了任务核心:

“将倾倒转化为琥珀色细流注入杯形图案。扁平椭圆环模拟油脂层。还原原始倾倒的外观与停顿,不使用写实蒸汽。无文字。”

“字体规则:在最终拍前,利用裁切的字干、字碗、字怀与发丝笔画构成纹理。避免使用可读小字或伪文字串。移除设备上所有可读品牌标识。产品名称作为唯一例外。”

“此方案保留了参考的节奏与编排,同时将其视觉语言转换为你描述的动态设计。”

分解产物才是此工作流的真正价值所在。一旦完成,视频生成几乎成为形式。

第三步:分镜门控

视频积分最昂贵,静态帧则便宜。因此,在任何渲染前,我先让模型展示九格静帧:

“生成3×3九格分镜网格,对应简报的九个拍节。每帧使用分解中的确切调色板。随后提供一页HTML格式品牌手册,包含调色板与色值、字体比例与间距规则。”

九帧图像,每帧标注拍节与时间戳,采用分解中的铜色与炭灰色系。产品名称仅在第九帧出现,此前全部为形态与纹理。这是本次创作中首次出现设计感的时刻。

客户批准分镜。无人愿意等待视频渲染才发现第五帧有问题。当单帧出错时,仅修正该帧:

“第5帧,产品放大30%。第8帧过暗,背景提亮一档。仅重新生成这两帧,其他不变。”

本次九帧全部通过,我直接批准了整个网格。

品牌手册借鉴了Higgsfield视频的技巧:要求HTML格式可确保字体色彩在所有渲染中保持锁定。手册包含六个色值、字体比例(最终产品名称112px,大纹理字240px,小纹理字56px,400字重高对比度杂志衬线体)、8px间距单位、96px安全边距,以及包含分解中所有拍节时间窗口的动态帧映射表。

第四步:渲染五版,择一而行

“批准。基于分镜序列渲染5版15秒广告。保持分解中的调色板、时间码与镜头运动。仅版本间变化转场方式与文字入场动效。使用你为高端产品广告推荐的Higgsfield模型与预设。”

此处「导演」职责显现:渲染前它核查了自身推荐:

“Cinema Studio 3.0支持15秒渲染。光束扫描是独立的Seedance配方,非可直接应用于Cinema Studio的预设。我将在保持批准序列的前提下,将光束扫描开场效果融入这些渲染。”

接着它规划了五种处理方案:利落剪切、柔和溶解、定向划像、形状匹配转场、黑场淡入淡出。它注意到我的计划单次仅允许四次渲染,便将第五版加入队列,并关闭所有五版的配乐——避免音乐成为版本差异点。这些细节我均未要求。

18分29秒后,我获得五个文件:01-clean、02-dissolve、03-directional、04-shape-match、05-fade-through-black。全部15秒竖版1080p,基于Cinema Studio Video 3.0。

其中四版如分镜般生动呈现,有一版却不然——开场直接显示分镜网格,九格画面平铺屏幕数秒,该渲染字面意义上动画化了我提供的参考图。直接丢弃。这正是为何要渲染五版而非一版。

永远勿发首版。五版渲染,择一留存,并为留存版附上具体修改意见:

“版本[N]:最后一帧延长0.5秒,产品名称以纹理形态入场并解析为完整单词。其他不变。”

我的积分耗尽前未能发送该修改意见,因此下方展示的是节拍间采用柔和溶解的原始渲染版本。注意最后一拍:产品名称以碎片字母入场并解析为完整单词——这正是我在修改意见中提出的需求,而它已自主实现。

现在展示首次尝试与当前版本对比:相同产品、相同15秒时长、相同对话窗口。差异仅在于后者基于分解分析进行创作。

接下来是诚实部分——演示视频从不展示的:

字体纹理化概念有效但有限。在某些镜头中,裁切字母不再作为纹理,而成为漂浮的杂乱字形——三个字母在产品旁停留一秒,如同遗忘文字的字幕。产品也存在轻微漂移:电源键与四点标识在机身周围移动,某帧设备比下一帧更纤细。Astra在渲染前曾警告漂移问题,它说对了。若明日发布,我会发送带修正提示的两帧,锁定产品比例与照片一致,并重新渲染。

第五步:保存分解模板

此步骤在两个演示视频中均未出现,却是代理商价值的体现:

“将此分解保存为可复用模板,命名「高端产品广告15秒」。剔除咖啡机特定内容,以便用于不同品类的下个产品。输出为markdown格式。”

两分钟后,它保存了文件:产品中立化,包含占位符、固定时间码、镜头运动、九格分镜规则、字体规则、间距系统、五版对比表及交付清单(首条为「精确15.000秒 / 24fps下360帧」)。它甚至为我撰写了复用提示词:

“使用「高端产品广告15秒」模板,按以下要求调整:[具体产品描述]…”


(文章结尾因积分限制中断,后续应包含免费版本说明、成本对比及完整构建清单)

相似文章

GPT-6 Astra 与 Tom Krcha 合作

YouTube AI Channels

OpenAI 的 GPT-6 Astra 是一个 AI 驱动的创意助手,它通过处理参数化任务、迭代视觉概念以及生成功能性资产(如着色器)来提升设计和工程工作流程,正如 Tom Krcha 在各种项目中所展示的那样。