中文精炼导读
核心观点
- Jay Alammar 用 AI 图像生成工具(Stable Diffusion / Dream Studio、DALL-E、Midjourney)重新制作 1987 年 MSX 游戏《Nemesis 2》开场过场动画的图形——一个"用现代生成式 AI 重讲童年视觉故事"的亲身实验。
- 实验的核心结论之一是"prompt 是一门需要咒语的学问":只描述画面主体远远不够,必须加上把模型导向特定风格的"秘钥关键词"——为此他依赖 Lexica 这类包含数百万示例与对应 prompt 的画廊来偷师,而不是死记针对特定版本模型有效的魔法词。
- 三家工具各有长短:Midjourney 以最少的 prompt 调整产生最好的生成质量(最接近"美"),但只能通过 Discord 使用、无法通过 API 或浏览器生成;Stable Diffusion 开源、有 API、界面最好用,是作者使用最多的;DALL-E 的 inpainting/outpainting(画布扩展)"有点魔法",但简单 prompt 下的质量落后 Midjourney。
- 失败案例同样有教学价值:重现角色"三只眼"这个标志性元素多次失败、inpainting 也没能在时限内调出好结果;生成正确文本仍是当前工具的短板(最终星图是作者把图导入 Photoshop 手动加的文字和线条)。
- 工具对比之外,文章还验证了一个工作流范式:先用 Midjourney 生成风格接近的底图,再用 DALL-E 的 outpainting 扩展画布——不同工具各取所长地组合,才是把 AI 图像生成用于"重制旧素材"的现实路径。

内容精讲
故事的起点是作者童年的一段记忆:1987 年的《Nemesis 2》(MSX 平台的宇宙巡航机系列作品)开场动画里有一位反派——"Venom 博士",一个绿皮肤、红眼睛、穿着带肩刺红大衣、从监狱铁栏后现身的"绅士"。Alammar 想看看现代 AI 图像生成工具能否把这些 35 年前的 8-bit 风格画面,重做成更高保真度的版本,并借此观察这些商业工具到底能做什么、在哪里失败。
第一块试金石是开场第一个画面:战斗机群飞过太空中的红色行星。作者先用 DALL-E 跑了一个只描述主体的 prompt("fighter jets flying over a red planet in space with stars in the black sky"),结果完全不是复古科幻的风格;同样的 prompt 贴进 Dream Studio(Stable Diffusion 的托管版),也得不到想要的画面。这让他得出第一个核心经验:prompt 必须包含引导模型走向特定风格的"秘钥"——于是他去 Lexica(一个收录数百万 Stable Diffusion 生成图及其 prompt 的画廊)找喜欢的图,保留其风格关键词、换掉主体,最终拼出一个能用的咒语式 prompt(加入 lava、ussr、soviet、vintage retro scifi、trending on artstation、dramatic lighting 等词)。他指出,死记对特定版本模型有效的魔法词不是长期策略,学会从画廊检索和组合风格才是。

接着是第二个画面(Dr. Venom 在监狱铁栏后)的生成。作者先试了 Midjourney——结果惊艳,但"更漂亮"不等于"更还原":Midjourney 的版本没有像 Stable Diffusion 那版那样抓住原图的精髓。他随即决定,故事剩余部分都用 Midjourney 来生成。这个过程也展示了生成工具的"不可控性":想让他戴手铐被锁链捆住,模型就是出不来那种姿态与束缚感;最终改用"从铁栏后面看向镜头"的画面构图,成功绕开了模型不擅长的"姿势控制"。后续每个画面他都记录下成功的 prompt 与失败的尝试:飞船蓝图(--ar 3:2 指定宽高比)、星图、以及一个反复失败的标志性元素——三只眼。这个"三只眼"的失败很有代表性:无论换什么 prompt,模型都不生成三只眼的样子;用 Dream Studio 的 inpainting(只重绘擦除的部分)也没能在时限内调好。作者打趣说,翻翻画廊就知道模型其实很擅长生成各种恐怖的眼睛图——它只是不按你要的方式放对位置。
工具体验的总结部分最有参考价值。Dream Studio(作者几个月里用得最多):优点是把开源 Stable Diffusion 做成托管服务、提供 API 可编程调用、界面最好用(关键滑杆和候选数量一目了然),且因为是开源模型,未来需要微调自己模型时可以退回开源版本;缺点是不稳健地保存生成历史,且旧版本(1.4/1.5)在画廊辅助下更容易出好结果。Midjourney:优点是一致公认的最好生成质量、最少 prompt 调整,UI 自动保存生成存档,网站社区 tab 就是一个"Midjourney 自己的 Lexica";缺点是只能通过 Discord 访问(作者认为这不是有说服力的渠道)、试用用户要在公共频道生成、没有选择图像尺寸等选项的 UI 组件(只能往 prompt 里加命令)、也没有 API 和浏览器入口。DALL-E:优点是第一个惊艳世界的、支持 inpainting/outpainting、保存完整生成历史、有 API;缺点是比 Stable Diffusion 慢一点(不过一次给四个候选)、简单 prompt 下的质量落后 Midjourney、社区采用与工具生态不如 Stable Diffusion。作者特别为 outpainting(把画布向外扩展并自动补全周围内容)着墨——他把已生成的飞船船长头像上传进 DALL-E 的编辑器,多轮扩展把周围空间一点点补全,这个体验"有点魔法",是他接下来想多探索的方向;但他也提醒别小看 DALL-E,OpenAI 是开拓者,下一版模型的生成质量值得期待。

文章结尾点出当前工具的普遍限制:其一,在图像里正确复现文字仍不普及(虽然 Imagen 已证明技术上可行)——星图上的文字和线条是他用 Photoshop 手动加的;其二,文本转图像不是适合"指定元素的精确放置或操控"的范式。整体而言,这篇实验文章的价值在于它记录了 2023 年初这个时间点商业 AI 图像工具的真实工作流:咒语式 prompt、画廊检索、inpainting/outpainting 补救、多工具组合,以及"每个画面都要反复调、常常失败、偶尔惊艳"的日常现实。
阅读价值
适合 AI 图像生成工具用户、独立开发者与游戏/视觉从业者:文章用一个完整项目(重制《Nemesis 2》开场动画)展示了 Stable Diffusion、Midjourney、DALL-E 三家的真实能力差异与各自短板,记录了从"咒语式 prompt"到 inpainting/outpainting 的完整工作流;对想理解"AI 图像生成能做不能做什么、怎么组合工具"的人很有参考价值。
本文为中文精炼导读,由 AI 基于原文整理,内容与图片版权归原作者所有。原文: http://jalammar.github.io/ai-image-generation-tools/