我将 GPT-6 Astra 的计算机使用推向极限

YouTube AI Channels 模型

摘要

本文通过跨10个应用程序委派任务来测试 GPT-6 Astra 的计算机使用能力,评估其像人类一样操作软件的能力,并突出其在现实场景中的优势和局限性。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/09/16 00:14

**简短总结**:测试者通过在10款不同应用中委托真实任务,测试GPT-6 Astra的新计算机操作能力,评估其像人类一样操作界面的能力,涵盖创意软件到模拟工具。 ## 在10款应用中测试Astra的计算机操作能力 自GPT-6 Astra发布以来,其计算机操作功能实现了重大飞跃。与以往缓慢且不可靠的AI工具不同,Astra在处理真实软件中的实际任务时已值得信赖。测试者在10款应用中进行了测试,包括视频编辑、图像创作、3D建模、乐高设计,甚至在GarageBand中演奏乐器。所有测试均通过ChatGPT桌面版应用中的Codex功能进行,展示了其像人类一样点击、输入和拖拽的能力。 ## Google Earth Studio:从提示生成复杂动画 首次测试使用Google Earth Studio创建犹他州的复杂飞越动画。提示词详细描述了从州议会大厦出发,飞越盐湖城,穿越拱门国家公园并穿过精致拱门的路径。第一次尝试耗时11分49秒,生成了一个扎实但较慢的结果,存在一些方向性问题。经过大约23分钟的后续三次迭代后,最终动画被评为“基本完美”。 经验是:如果初始提示更详细,Astra可以首次就实现近乎完美的结果,节省时间,后期仅需进行微小手动调整。这种工作流程——发送提示、处理其他事务、再调整结果——优化了Astra的优势。 ## Canva:创意插图生成 在Canva中进行的纯创意测试要求Astra绘制一个原创的、复杂的创意概念,不模仿现有作品。通过迭代提示逐步增加复杂度: - 第一次尝试(3分57秒):“漂浮的温室” - 第二次尝试(7分14秒):“发条守夜人” - 第三次尝试(20分47秒):“多彩的商队” 最终成果色彩更丰富、细节更多,令人印象深刻。Astra还被要求将这幅画转化为照片级真实的图像,并成功完成。 ## Adobe Photoshop:自动创建缩略图 Astra的任务是在Photoshop中从头开始制作视频缩略图,使用提供的照片。它执行了背景移除、更改测试者衬衫颜色、生成独立元素,并添加文本和效果,全程拥有创作自由度。 - 第一次尝试(25分钟):产出一个良好的开端,包含所有必要图层。 - 后续修改(14分钟 + 20分钟):完善了设计。 总耗时约一小时,可能比手动操作慢。然而,关键优势在于委托——测试者可以离开,通过手机远程进行后续调整,而Astra在后台工作。最终缩略图已用于该视频。 ## Adobe Premiere:添加文本和动画 在Premiere中进行视频编辑时,Astra被要求为现有片段添加带动画的标题文本,然后为时间轴上的图像添加弹跳和摇晃动画。 - 第一次尝试(12分钟):完成了文本动画。 - 第二次请求(13分钟):包括搜索并添加合适的音效。 结果良好,有效处理了手动关键帧设置和声音同步等繁琐工作。 ## Adobe Illustrator:具有挑战性的矢量重制 在Illustrator中的一项复杂挑战是使用干净的矢量形状和路径重制特定图形,而不是使用“图像描摹”功能。一个关键约束是:提示明确禁止使用代码、脚本、API或MCP,以强制Astra使用计算机操作界面,而非Illustrator的Python API。 - **计算机操作路径**:两次尝试(40分钟 + 52分钟)结果不佳。 - **Python API路径(无约束)**:第一次尝试(20分钟)结果明显更好。后续两次调整(10分钟 + 15分钟)产出了更优的结果,尽管仍未与原图完全匹配。 对于复杂的矢量项目,Astra的计算机操作方法可能不是最佳选择,而允许其使用最有效的方法(Python API)则效果更好。 ## 乐高、火箭与鲁布·戈德堡模拟 Astra还处理了它可能从未使用过的专业模拟和设计软件: - **BrickLink Studio**:设计了一个由257块乐高积木组成的精致拱门模型,分解为27个组装步骤。 - **Open Rocket**:设计了一枚能稳定达到1000米高度并安全回收的火箭,运行并迭代模拟直至满足两项约束。 - **Algadoo**:构建了互动的鲁布·戈德堡式机器,首先是一个有5个交互环节的简单版本,然后是一个更复杂的版本。 ## Blender:3D建模与迭代改进 使用计算机操作模式进行的Blender测试旨在3D重制精致拱门。该过程凸显了Astra的迭代学习能力: - 第一次尝试(15分钟):结果不佳。 - 后续迭代中,Astra会打开浏览器与真实照片对比,重建模型,访问Blender的节点系统以设置纹理,并完善周边景观。 - 大约50分钟后,得到了显著改进的结果。最后为追求完美进行了大量额外工作。 测试者指出,Astra能够视觉化地评判其输出并循环迭代,但通常最好限制此过程以防过度消耗token。拱门有机、不对称的形状使其成为一个特别具有挑战性的测试。 ## 结论:一款实用的委托工具 测试表明,Astra的计算机操作功能在委托真实任务方面是可靠的,尤其是在熟悉的软件中自动化繁琐工作或处理不熟悉的应用程序。其优势在于处理后台工作,将用户解放出来进行其他活动。为获得最佳使用效果,建议提供详细的初始提示,并采用“提示-然后微调”的工作流程。 来源:https://www.youtube.com/watch?v=2hTtpFVZE5A

相似文章

GPT-6 Astra 基准测试

Reddit r/singularity

本文介绍了OpenAI的GPT-6模型的基准测试,使用Astra基准测试系统评估其性能。

GPT-6 Astra

Hacker News Top

OpenAI 推出了 GPT-6 Astra,这是一个最先进的 AI 模型,在多个基准测试中获得高分,并在计算机使用、对齐和专业任务方面表现出色,即将向用户推出。

GPT-6 Astra:工作智能的下一代

OpenAI Blog

OpenAI发布了GPT-6 Astra,这是一款专为专业工作优化的尖端AI模型,具备在计算机使用、编码和企业工作流方面的高级能力,并提升了安全性和效率。