ChatGPT 新 Images 2.0 模型生成文本能力超乎预期

ChatGPT Images 2.0 大幅提升 AI 图像生成质量,尤其在文字渲染上取得突破,已能生成可直接使用的餐厅菜单等实用内容。技术层面虽未公开底层架构,但新版在指令遵循、细节保留及非拉丁文字处理上显著改进,并具备“思考能力”,支持联网搜索与多图生成复核。该模型标志着 AI 图像工具正从“演示型产品”向“生产型工具”转型,其核心价值不在于“画得更像”,而是“错得更少”,将推动 AI 图像在实际内容生产场景的落地应用。

发布于2026年5月2日 22:41
编辑小创
评论0
阅读22

ChatGPT 新图像模型把 AI 味压到了更低

两年前,判断一张图是不是 AI 生成,往往不用费太多力气。尤其碰到带文字的图片,破绽几乎一眼可见。比如让图像模型生成一份墨西哥餐厅菜单,它很可能会凭空造出“enchuita”“churiros”“burrto”“margartas”这种像英文又不像菜名的词。现在,这个时代基本过去了。

当测试 OpenAI 最新的 ChatGPT Images 2.0 时,模型已经能生成一份足以直接摆进餐厅使用的墨西哥菜单,普通顾客大概率不会察觉异常。当然,文中把 ceviche 标到 13.50 美元,多少还是会让人对鱼的新鲜程度起点疑心。

下面这张是两年前 DALL-E 3 生成的结果。那时候, ChatGPT 还不具备图像生成功能。

过去, AI 图像生成器在拼写上的短板几乎是行业通病。一个关键原因在于,它们大多基于扩散模型 ( diffusion models )。这类模型的工作方式,是从噪声中一步步重建图像。 Lesan AI 创始人兼 CEO Asmelash Teka Hadgu 在 2024 年接受 TechCrunch 采访时解释过,扩散模型本质上是在重构输入内容,而图像里的文字只占极少数像素,模型更容易优先学习那些覆盖面积更大的视觉模式。说白了,在这种训练逻辑下,文字一直不是重点。

后来,研究人员开始尝试别的路径,比如自回归模型 ( autoregressive models )。这类模型会预测图像接下来应该长什么样,工作方式更接近大语言模型 ( LLM )。这也解释了为什么新一代图像模型在排版、文字和复杂结构上突然进步这么快。不过, OpenAI 在本周的媒体沟通会上拒绝回答一个关键问题。 ChatGPT Images 2.0 到底采用了哪一类底层模型,公司没有明说。

OpenAI 给出的说法是,新模型具备“思考能力”。按照官方描述,这种能力让它可以联网搜索、基于一条提示词生成多张图,并对生成结果进行复核。落到实际用途上,这意味着 Images 2.0 不只是会画图,它已经能更稳定地生产营销素材,比如自动适配不同尺寸的广告图,也能生成多格漫画这种过去很容易翻车的复杂内容。

OpenAI 还表示, Images 2.0 在非拉丁文字的渲染上也更强,日语、韩语、印地语、孟加拉语这些语言的文本表现都有提升。模型的知识截止时间是 2025 年 12 月。如果提示词涉及更晚发生的新闻事件,生成内容的准确性可能会受影响。

按照 OpenAI 在新闻稿中的表述, Images 2.0 在图像生成的精确度和保真度上达到了一个前所未有的水平。它不仅能理解更复杂的视觉概念,也能更有效地把这些要求真正落实到图像里。指令遵循、细节保留,以及那些过去最容易让图像模型失手的元素,比如小尺寸文字、图标、用户界面元素、密集构图和细微风格约束,现在都被列为它的强项,输出分辨率最高可达 2K 。

代价也很直接。它不像在 ChatGPT 里打一行问题那样几乎即时返回。生成复杂内容需要时间,但速度也没有慢到不可接受。像一组多格漫画,几分钟内就能完成。这对多数内容生产场景来说,已经够用了。

OpenAI 表示,从周二起,所有 ChatGPT 和 Codex 用户都可以使用 Images 2.0 。付费用户能够生成更高级的输出结果。公司也会同步开放 gpt-image-2 API ,价格将根据输出质量和分辨率来定。

相关文章

Claude 新模型发布前让客户极限测试,Agent 落地成核心
AI 新闻资讯
2026年6月1日
0 条评论
小创

Claude 新模型发布前让客户极限测试,Agent 落地成核心

Anthropic 在发布新 Claude 模型前,通过头部客户极限测试验证真实业务表现,比单纯跑分更具参考价值。借助 Agent 能力,新模型在起草法律文件等复杂任务中成功率提升约 20%,实现持续准确输出。当前大模型发展重心已转向 Agent 在垂直场景的落地,边缘案例为下一代优化指明方向。这种与客户深度共创的模式建立了高信任壁垒,值得产品团队借鉴。

#Anthropic#智能体
阅读全文
Claude Opus 4.8 震撼发布,多智能体协同让开发效率翻倍
AI 新闻资讯
2026年6月1日
0 条评论
小创

Claude Opus 4.8 震撼发布,多智能体协同让开发效率翻倍

Anthropic 发布 Claude Opus 4.8,在基准测试中超越 ChatGPT 5.5,重夺编程领域领先地位。新版本核心亮点为动态工作流与 Ultracode 模式,通过多智能体协同大幅提升复杂任务开发效率,同时幻觉率降至四分之一。得益于算力扩充,其性能提升且价格下调,快速模式费用降至三分之一。建议开发者日常使用常规上下文模式并调高努力程度,大项目再开至最大。此外,AI 时代专注力仍是拉开差距的关键。

#Claude#AI 编程
阅读全文
Linear + Claude Code:给 AI 装上项目大脑
AI 新闻资讯
2026年5月22日
0 条评论
小创

Linear + Claude Code:给 AI 装上项目大脑

AI 技术博主 Alex Finn 提出利用免费工具 Linear 将 Claude Code 转化为自主智能体的工作流。该方案要求先将项目拆解为带优先级和验收标准的任务(Issue)录入 Linear,随后 AI 可自动领取任务、编写代码、执行测试并更新状态,全程无需人工干预。此模式有效解决了传统氛围编程中指令中断或偏离的问题,通过 Linear 作为“第二大脑”提供结构化上下文,显著提升产出质量。此外,该流程支持跨设备多智能体协同及 Git 分支管理,配合 Slack 通知实现高效团队协作。

#Claude Code#智能体工程
阅读全文
互动讨论

评论区

围绕《ChatGPT 新 Images 2.0 模型生成文本能力超乎预期》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。