中文翻译
摘要: ChatGPT Images 2.0 在文字渲染上实现重大突破,生成的墨西哥菜单等图像逼真自然,几乎无需人工修正。相比旧版扩散模型,新模型可能采用更先进的自回归架构,具备“思考”能力:支持联网搜索、单提示多图生成及自我校验,并能创作多格漫画。此外,其对日语等非拉丁文字的识别能力显著增强,知识截止至 2025 年 12 月。尽管 OpenAI 未透露具体技术细节,但 Images 2.0 已展现出前
正文
过去,区分人类创作与 AI 生成的图像相对容易——就在两年前,你根本无法使用图像生成模型为一家墨西哥餐厅设计菜单,而不会创造出诸如"enchuita"(虚构的“恩丘伊塔”)、"churiros"、“burrto"和"margartas"等凭空捏造的美食名称。
如今,当我向全新的 ChatGPT Images 2.0 模型请求一份墨西哥美食菜单时,它生成的内容几乎可以直接用于真实餐厅,顾客甚至难以察觉其中有任何违和之处。(不过,如果酸橘汁腌鱼标价高达 13.50 美元,我可能会怀疑其食材品质。)
图片来源:ChatGPT Images 2.0
作为对比,以下是我在两年前从 DALL-E 3 获得的生成结果(当时 ChatGPT 尚不具备图像生成功能):
图片来源:Microsoft Designer (DALL-E 3)
长期以来,AI 图像生成器在文字渲染方面一直表现不佳,这主要是因为它们普遍采用扩散模型(diffusion models)。这类模型的工作原理是从噪声中重建图像。
Lesan AI 创始人兼首席执行官 Asmelash Teka Hadgu 曾在 2024 年接受 TechCrunch 采访时指出:“扩散模型本质上是在重构给定的输入。我们可以认为图像中的文字仅占极小一部分像素,因此图像生成器会优先学习覆盖更多像素的通用模式。”
此后,研究人员开始探索其他图像生成机制,例如自回归模型(autoregressive models)。这类模型通过预测图像应有的形态来工作,其行为更接近大型语言模型(LLM)。
不幸的是,OpenAI 在本周的一次媒体简报会上拒绝回答关于驱动 ChatGPT Images 2.0 的具体模型类型的问题。
TechCrunch Disrupt 活动宣传
在 TechCrunch Disrupt 2026 上遇见您的下一位投资人或投资组合初创企业。
您的下一轮融资、下一次关键招聘、下一个突破性机遇,都将在此汇聚。
本次活动将于 2026 年 10 月 13 日至 15 日在美国加利福尼亚州旧金山举行,届时将有超过 10,000 名创始人、投资者和技术领袖齐聚一堂,参与为期三天、涵盖 250 多场战术研讨会的盛会,体验高效的人脉对接与市场定义型创新。
立即注册,最高可节省 410 美元。
尽管未透露具体模型架构,OpenAI 表示新模型具备“思考能力”,使其能够执行以下功能:搜索互联网、根据单一提示生成多张图像,并对自身创作进行二次校验。这使得 Images 2.0 不仅能生成不同尺寸的营销素材,还能创作多格漫画。
此外,OpenAI 还指出,Images 2.0 对非拉丁文字系统(如日语、韩语、印地语和孟加拉语)的理解能力显著增强。该模型的知识截止时间截至 2025 年 12 月,这可能影响其在涉及近期新闻的提示词生成中的准确性。
"Images 2.0 将前所未有的精确度与保真度带入了图像创作领域。它不仅能够……"
采集时间: 2026-04-22 20:16:24
AIGPTChatGPT微软人工智能
