从DALL-E到Midjourney:主流AI绘画模型横评

对应课程进阶篇(13-17讲)及扩散模型方案篇(26-27讲),深度对比DALL-E 2/3、Imagen、Stable Diffusion/SDXL、Midjourney的技术架构与效果差异。

一、AI绘画模型发展脉络

2021.01 ── DALL-E 1(离散VAE + Transformer)
2022.04 ── DALL-E 2(unCLIP = CLIP + 扩散模型)
2022.05 ── Imagen(T5 + 级联超分辨率扩散)
2022.07 ── SD 1.4(LDM = VAE + UNet + CLIP,开源)
2022.07 ── Midjourney v3(闭源,Discord交互)
2022.11 ── SD 1.5(改进版,社区生态爆发)
2023.07 ── SDXL 1.0(双分支 + Refiner)
2023.10 ── DALL-E 3(GPT-4重写Prompt + 改进扩散)
2024-26  ── SD3 / Flux / Midjourney v6+(DiT架构)

二、DALL-E 2:前浪的技术方案

2.1 unCLIP架构

文本 → CLIP Text Encoder → 文本嵌入
                                │
                    ┌───────────┴───────────┐
                    │                       │
              Prior (扩散)          CLIP Image Embedding
                    │                       │
              采样图像嵌入                  │
                    │                       │
                    └───────────┬───────────┘
                                │
                    Decoder (扩散模型)
                                │
                          生成图像 64×64
                                │
                    级联超分辨率扩散 ×2
                                │
                          256×256 图像

2.2 DALL-E 2的核心创新

创新说明影响
unCLIP从CLIP嵌入反推图像文本→图像的优雅桥接
Prior模型文本嵌入→图像嵌入的扩散弥补CLIP的模态差距
图像变体给一张图生成变体图像编辑能力
图像插值两张图之间过渡创意探索

2.3 DALL-E 2的局限

  • 分辨率仅256×256(需级联超分)
  • CLIP嵌入信息瓶颈(768维限制语义表达)
  • 长文本理解能力有限(CLIP的77token限制)

三、Imagen:后来居上的挑战者

3.1 架构对比

组件DALL-E 2Imagen
文本编码器CLIP Text (77 token)T5-XXL (256 token)
文本→图像Prior + Decoder直接条件扩散
超分辨率扩散级联扩散级联
基础分辨率64×6464×64
最终分辨率256×2561024×1024

3.2 Imagen为什么更好

1. T5编码器优势:
   - 更长上下文(256 vs 77 token)
   - 更强语言理解(T5是通用大语言模型)
   - 对复杂描述理解更准确

2. 去掉Prior:
   - 直接用文本嵌入条件化扩散模型
   - 减少信息传递环节
   - 训练更简单

3. 更强的超分辨率:
   - 两级超分:64→256→1024
   - 文本条件贯穿所有阶段

3.3 关键结论

文本编码器的质量决定了图像生成的上限。 Imagen用T5替代CLIP,证明了通用语言模型比对比学习训练的CLIP更适合做文本编码。

四、Stable Diffusion:开源之王

4.1 LDM架构

文本 → CLIP Text Encoder → 条件嵌入
                                │
图像 → VAE Encoder → 潜变量 z₀    │
                    │             │
            在潜空间扩散            │
            zₜ → zₜ₋₁ → ... → z₀  │
            (UNet预测噪声)←──────┘
                    │
            VAE Decoder → 生成图像

4.2 SD vs DALL-E 2 vs Imagen

维度DALL-E 2ImagenSD 1.5
文本编码器CLIPT5-XXLCLIP
扩散空间像素空间像素空间潜空间
开源❌❌✅
可微调❌❌✅
社区生态❌❌✅
硬件要求APIAPI6GB VRAM

4.3 SD成功的三大因素

1. 潜空间扩散:计算量降低48倍,消费级GPU可运行
2. 完全开源:模型权重、训练代码、推理代码全部开放
3. 社区生态:Civitai模型分享、LoRA/DreamBooth微调、插件生态

五、SDXL:从图像变体到神雕侠侣

5.1 SDXL架构创新

SD 1.5:单UNet,512×512
SDXL:双UNet + Refiner

Base模型 (1024×1024)
  ├─ 更大的UNet(2.6B参数 vs 860M)
  ├─ 双文本编码器(CLIP ViT-L + CLIP ViT-bigG)
  └─ 更大的潜空间(128×128×4)

Refiner模型
  └─ 在Base输出的基础上进一步精修高频细节

5.2 SDXL双文本编码器

# SDXL使用两个CLIP编码器
# CLIP ViT-L/14: 768维
# CLIP ViT-bigG/14: 1280维
# 拼接后:2048维文本嵌入

# 好处:
# 1. 更强的文本理解能力
# 2. 互补的编码信息
# 3. 对长文本更友好

5.3 SDXL vs SD 1.5 效果对比

维度SD 1.5SDXL
默认分辨率512×5121024×1024
文字生成几乎不可能偶尔可以
人体结构常有畸形明显改善
构图能力一般更专业
显存需求6GB12GB
推理速度快慢约2-3倍

六、Midjourney:年入1亿美元的秘密

6.1 Midjourney技术推测

Midjourney从未公开架构,基于效果和公开信息推测:

1. 基础架构:大概率基于扩散模型(SD变体或自研)
2. 文本编码:可能使用更强的语言模型
3. 美学调优:大量人工美学标注数据
4. 后处理:可能有专门的增强管线
5. 模型蒸馏:多模型集成后蒸馏为单模型

6.2 Midjourney的商业模式

维度策略效果
交互方式Discord机器人降低使用门槛
定价$10-60/月订阅门槛低,用户量大
质量默认参数即出好图减少用户调参负担
社区Discord社区展示自然增长,社交传播
迭代快速版本更新v3→v4→v5→v6持续进化

6.3 Midjourney vs SD 效果差异

Midjourney优势:
  - 默认美学质量更高(光影、构图、色彩)
  - 对Prompt的理解更"聪明"(不需要大量质量词)
  - 风格一致性更好

Stable Diffusion优势:
  - 完全可控(参数、模型、插件)
  - 可微调(LoRA/DreamBooth/ControlNet)
  - 可商用(开源协议)
  - 可本地部署(数据不出域)

七、DALL-E 3:用OpenAI的方式搞数据

7.1 DALL-E 3的核心创新

传统流程:用户Prompt → CLIP编码 → 扩散生成
DALL-E 3:用户Prompt → GPT-4重写 → 更详细描述 → 扩散生成

关键区别:用GPT-4把用户的简短描述扩展为详细的图像描述

7.2 数据策略

问题:训练数据中(描述, 图像)对的描述太简短
      "一只猫" 对应一张高质量猫的照片
      扩散模型学到的是"一只猫"→猫,但忽略了细节

DALL-E 3的解决方案:
  1. 用强Caption模型给训练图像生成详细描述
     "一只猫" → "一只橘色的猫坐在窗台上,阳光从左侧照入..."
  2. 用(详细描述, 图像)重新训练扩散模型
  3. 推理时用GPT-4把用户Prompt扩展为详细描述

结果:模型学到更丰富的文本-图像对应关系

7.3 从unCLIP到缝合怪方案

DALL-E 2:unCLIP架构(CLIP嵌入 → 扩散)
DALL-E 3:缝合怪(多个组件拼接)

推测架构:
  GPT-4(Prompt重写)
    → 强文本编码器(可能是T5或自研)
    → 改进的扩散模型(可能借鉴SD/Imagen)
    → 多级超分辨率
    → 安全过滤器

7.4 DALL-E 3 vs SD vs MJ

维度DALL-E 3SDXLMJ v6
文字理解★★★★★ (GPT-4)★★★★★★★
图中文字★★★★★★★★★★★
可控性★★★★★★★★★★
开源❌✅❌
价格API计费免费订阅制
微调能力❌✅❌

八、模型选择决策树

你需要什么?
│
├─ 快速出好图,不在乎控制
│  └─ Midjourney / DALL-E 3
│
├─ 完全控制 + 本地部署
│  ├─ 显存 ≥ 12GB → SDXL + ComfyUI
│  ├─ 显存 6-12GB → SD 1.5 + WebUI
│  └─ 显存 < 6GB → SD 1.5 + --lowvram 或 API
│
├─ 商业项目 + 数据安全
│  └─ SDXL 本地部署 + 自定义LoRA
│
├─ 角色一致性
│  └─ SD + LoRA/DreamBooth + ControlNet
│
└─ 视频/动画生成
   └─ SD + AnimateDiff 或 Sora API

九、总结

AI绘画模型的竞争格局:

开源生态:Stable Diffusion / SDXL / SD3 / Flux
    优势:可控、可微调、免费、社区
    劣势:默认效果需调参

商业服务:Midjourney / DALL-E 3
    优势:开箱即用、美学质量高
    劣势:不可控、不可微调、持续付费

技术趋势:
    1. 文本编码器越来越强(CLIP → T5 → GPT-4)
    2. 骨干网络从UNet转向DiT
    3. 数据质量比数据量更重要
    4. 多模态融合(文+图+视频+3D)

下一篇:LoRA与ControlNet精准控制实战 — 动手训练LoRA、使用ControlNet实现精准构图控制。


本文对应课程进阶篇13-17讲及扩散模型方案篇26-27讲,总时长约1小时20分钟。

Logo

立足具身智能前沿赛道,致力于搭建全球化、开源化、全栈式技术交流与实践共创平台。

更多推荐