推出 4o 图像生成功能

OpenAI Blog 模型

摘要

OpenAI 在 GPT-4o 中引入原生图像生成功能,具有改进的文本渲染、精确的物体处理(10-20 个对象)和通过对话优化的上下文感知生成能力。该模型擅长生成实用的、具有交流价值的图像,具有准确的符号渲染和与上传图像的集成功能。

在 OpenAI,我们一直相信图像生成应该是我们语言模型的核心功能。这就是为什么我们在 GPT-4o 中构建了迄今为止最先进的图像生成器。其结果是一个不仅美观,而且实用的图像生成功能。
查看原文
查看缓存全文

缓存时间: 2026/04/20 14:48

# 推出 4o 图像生成 来源:https://openai.com/index/introducing-4o-image-generation/ 通过原生多模态模型解锁有用且有价值的图像生成,能够实现精确、准确的逼真输出。 在 OpenAI,我们一直认为图像生成应该是我们语言模型的核心功能。这就是为什么我们在 GPT-4o 中内置了迄今为止最先进的图像生成器。结果是——不仅美观,而且实用的图像生成。 从远古时代的洞穴壁画到现代信息图表,人类一直使用视觉图像来交流、说服和分析——而不仅仅是装饰。当今的生成模型可以创造超现实、令人叹为观止的场景,但在处理人们用于共享和创建信息的实用图像时却表现欠佳。从徽标到图表,当用符号来表示共同的语言和经验时,图像可以传达精确的含义。 GPT-4o 图像生成擅长准确呈现文本、精确遵循提示,并利用 4o 的内在知识库和聊天上下文——包括转换已上传的图像或将其用作视觉灵感。这些功能使创建你所想象的确切图像变得更加容易,帮助你通过视觉更有效地交流,并将图像生成推进为具有精度和力量的实用工具。 我们在在线图像和文本的联合分布上训练我们的模型,学习的不仅是图像与语言的关系,还有图像之间的关系。结合积极的后期训练,生成的模型具有出人意料的视觉流畅性,能够生成有用、一致且上下文感知的图像。 一图胜千言,但有时在合适的地方生成几个词可以提升图像的含义。4o 将精确符号与图像融合的能力将图像生成转变为视觉交流工具。 由于图像生成现在是 GPT-4o 的原生功能,你可以通过自然对话来优化图像。GPT-4o 可以在聊天上下文中基于图像和文本进行构建,确保整个过程的一致性。例如,如果你在设计视频游戏角色,当你优化和实验时,角色的外观在多次迭代中保持一致。 GPT-4o 的图像生成能够细致入微地执行详细提示。而其他系统难以处理约 5-8 个物体,GPT-4o 可以处理 10-20 个不同的物体。物体与其特征和关系的更紧密绑定可以实现更好的控制。 GPT-4o 可以分析和学习用户上传的图像,无缝地将其细节整合到上下文中以信息化图像生成。 原生图像生成使 4o 能够在文本和图像之间建立知识链接,产生一个感觉更聪慧、更高效的模型。 在反映各种图像风格的图像上训练,使模型能够有说服力地创建或转换图像。 卡尔·马克思的一张逃犯风格的照片,他在美国购物中心停车场匆忙行走,回头看,表情惊恐,试图避免被拍照。他手中拿着装满奢侈品的多个光泽购物袋。他的外套在风中飘扬,其中一个袋子在行走时摇晃。背景模糊,有汽车和发光的购物中心入口来强调运动感。相机闪光灯部分过曝了图像,赋予它一种混乱的小报风格。 卡尔·马克思的一张逃犯风格的照片,他在美国购物中心停车场匆忙行走,回头看,表情惊恐,试图避免被拍照。他手中拿着装满奢侈品的多个光泽购物袋。他的外套在风中飘扬,其中一个袋子在行走时摇晃。背景模糊,有汽车和发光的购物中心入口来强调运动感。相机闪光灯部分过曝了图像,赋予它一种混乱的小报风格。 卡尔·马克思的一张逃犯风格的照片,他在美国购物中心停车场匆忙行走,回头看,表情惊恐,试图避免被拍照。他手中拿着装满奢侈品的多个光泽购物袋。他的外套在风中飘扬,其中一个袋子在行走时摇晃。背景模糊,有汽车和发光的购物中心入口来强调运动感。相机闪光灯部分过曝了图像,赋予它一种混乱的小报风格。 我们的模型并不完美。我们意识到目前存在多项限制,我们将在初始发布后通过模型改进来解决这些问题。 根据我们的模型规范,我们旨在通过支持游戏开发、历史探索和教育等有价值的用例来最大化创意自由——同时保持强大的安全标准。与此同时,阻止违反这些标准的请求仍然和以往一样重要。以下是我们正在努力实现安全、高效用内容并支持用户更广泛创意表达的额外风险领域的评估。 **通过 C2PA 和内部可逆搜索的来源追踪**所有生成的图像都带有 C2PA 元数据,将其标识为来自 GPT-4o,以提供透明度。我们还构建了一个内部搜索工具,利用生成的技术属性来帮助验证内容是否来自我们的模型。 **阻止不良内容**我们继续阻止可能违反我们内容政策的生成图像请求,例如儿童性虐待材料和性深度伪造。当真实人物的图像出现在上下文中时,我们对可以创建的图像类型有更严格的限制,特别是在裸露和图形暴力方面有强大的保障措施。与任何发布一样,安全永远不会完成,而是一个持续的投资领域。当我们了解更多关于该模型的真实世界使用情况时,我们将相应地调整我们的政策。 欲了解更多信息,请访问 GPT-4o 系统卡的图像生成附录 (https://openai.com/index/gpt-4o-image-generation-system-card-addendum/)。 **利用推理强化安全**类似于我们的深思熟虑对齐工作 (https://openai.com/index/deliberative-alignment/),我们训练了一个推理 LLM 直接从人工编写和可解释的安全规范工作。我们在开发过程中使用了这个推理 LLM 来帮助识别和解决我们政策中的歧义。结合我们的多模态进步和为 ChatGPT 和 Sora 开发的现有安全技术,这使我们能够对输入文本和输出图像进行调制 (https://openai.com/index/upgrading-the-moderation-api-with-our-new-multimodal-moderation-model/) 以符合我们的政策。 4o 图像生成从今天开始向 Plus、Pro、Team 和 Free 用户推出,作为 ChatGPT 中的默认图像生成器,Enterprise 和 Edu 用户将很快获得访问权限。它也可在 Sora 中使用。对于那些对 DALL·E 有特殊偏爱的用户,仍然可以通过专属的 DALL·E GPT 访问它。 开发者很快将能够通过 API 使用 GPT-4o 生成图像,访问权限将在未来几周内推出。 创建和自定义图像就像使用 GPT-4o 聊天一样简单——只需描述你需要的内容,包括任何特定信息,如宽高比、使用十六进制代码的精确颜色或透明背景。由于该模型能创建更详细的图片,图像渲染需要更长时间,通常需要长达一分钟。 制作人员:[Alex Duffy](https://every.to/@AlxAi) 制作人员:[Alex Duffy](https://every.to/@AlxAi) 制作人员:[Alex Duffy](https://every.to/@AlxAi)

相似文章

GPT-4o 系统卡附录:4o 图像生成

OpenAI Blog

# GPT-4o 系统卡附录:4o 图像生成 来源:[https://openai.com/index/gpt-4o-image-generation-system-card-addendum/](https://openai.com/index/gpt-4o-image-generation-system-card-addendum/) 4o 图像生成是一种新的、功能显著更强的图像生成方法,相比我们早期的 DALL·E 3 系列模型有大幅提升。它能够生成逼真的输出。它可以将图像作为输入并对其进行变换。它可以遵循详细的指令,包括可靠地在图像中融入文本等功能

推介我们最新的API图像生成模型

OpenAI Blog

# 推介我们最新的API图像生成模型 来源:[https://openai.com/index/image-generation-api/](https://openai.com/index/image-generation-api/) OpenAI上月在ChatGPT中推出图像生成功能后,它迅速成为我们最受欢迎的功能之一:全球超过1.3亿用户在短短[一周内⁠\(在新窗口中打开\)](https://www.linkedin.com/posts/bradlightcap_very-crazy-first-week-for-images-in-chatgpt-acti)创建了超过7亿张图像

Hello GPT-4o

OpenAI Blog

OpenAI发布GPT-4o,一个功能全面的多模态模型,可实时处理音频、视觉、文本和视频,平均音频响应延迟为232毫秒。该模型在文本和代码能力上与GPT-4 Turbo相当,同时显著改进了多语言、音频和视觉功能,API成本降低50%。

新版ChatGPT Images上线

OpenAI Blog

OpenAI发布了新一代旗舰图像生成模型,为ChatGPT Images提供支持。新模型生成速度提升4倍,编辑精度更高,并在ChatGPT中新增专门的Images功能,内置预设样式和滤镜。

GPT-4

OpenAI Blog

OpenAI 发布 GPT-4,一个大型多模态模型,接受图像和文本输入,在专业和学术基准测试中表现出人类水平的性能,在各种评估指标上的表现明显优于 GPT-3.5。