从DALL-E到Midjourney:主流AI绘画模型横评
·
从DALL-E到Midjourney:主流AI绘画模型横评
对应课程进阶篇(13-17讲)及扩散模型方案篇(26-27讲),深度对比DALL-E 2/3、Imagen、Stable Diffusion/SDXL、Midjourney的技术架构与效果差异。
一、AI绘画模型发展脉络
2021.01 ── DALL-E 1(离散VAE + Transformer)
2022.04 ── DALL-E 2(unCLIP = CLIP + 扩散模型)
2022.05 ── Imagen(T5 + 级联超分辨率扩散)
2022.07 ── SD 1.4(LDM = VAE + UNet + CLIP,开源)
2022.07 ── Midjourney v3(闭源,Discord交互)
2022.11 ── SD 1.5(改进版,社区生态爆发)
2023.07 ── SDXL 1.0(双分支 + Refiner)
2023.10 ── DALL-E 3(GPT-4重写Prompt + 改进扩散)
2024-26 ── SD3 / Flux / Midjourney v6+(DiT架构)
二、DALL-E 2:前浪的技术方案
2.1 unCLIP架构
文本 → CLIP Text Encoder → 文本嵌入
│
┌───────────┴───────────┐
│ │
Prior (扩散) CLIP Image Embedding
│ │
采样图像嵌入 │
│ │
└───────────┬───────────┘
│
Decoder (扩散模型)
│
生成图像 64×64
│
级联超分辨率扩散 ×2
│
256×256 图像
2.2 DALL-E 2的核心创新
| 创新 | 说明 | 影响 |
|---|---|---|
| unCLIP | 从CLIP嵌入反推图像 | 文本→图像的优雅桥接 |
| Prior模型 | 文本嵌入→图像嵌入的扩散 | 弥补CLIP的模态差距 |
| 图像变体 | 给一张图生成变体 | 图像编辑能力 |
| 图像插值 | 两张图之间过渡 | 创意探索 |
2.3 DALL-E 2的局限
- 分辨率仅256×256(需级联超分)
- CLIP嵌入信息瓶颈(768维限制语义表达)
- 长文本理解能力有限(CLIP的77token限制)
三、Imagen:后来居上的挑战者
3.1 架构对比
| 组件 | DALL-E 2 | Imagen |
|---|---|---|
| 文本编码器 | CLIP Text (77 token) | T5-XXL (256 token) |
| 文本→图像 | Prior + Decoder | 直接条件扩散 |
| 超分辨率 | 扩散级联 | 扩散级联 |
| 基础分辨率 | 64×64 | 64×64 |
| 最终分辨率 | 256×256 | 1024×1024 |
3.2 Imagen为什么更好
1. T5编码器优势:
- 更长上下文(256 vs 77 token)
- 更强语言理解(T5是通用大语言模型)
- 对复杂描述理解更准确
2. 去掉Prior:
- 直接用文本嵌入条件化扩散模型
- 减少信息传递环节
- 训练更简单
3. 更强的超分辨率:
- 两级超分:64→256→1024
- 文本条件贯穿所有阶段
3.3 关键结论
文本编码器的质量决定了图像生成的上限。 Imagen用T5替代CLIP,证明了通用语言模型比对比学习训练的CLIP更适合做文本编码。
四、Stable Diffusion:开源之王
4.1 LDM架构
文本 → CLIP Text Encoder → 条件嵌入
│
图像 → VAE Encoder → 潜变量 z₀ │
│ │
在潜空间扩散 │
zₜ → zₜ₋₁ → ... → z₀ │
(UNet预测噪声)←──────┘
│
VAE Decoder → 生成图像
4.2 SD vs DALL-E 2 vs Imagen
| 维度 | DALL-E 2 | Imagen | SD 1.5 |
|---|---|---|---|
| 文本编码器 | CLIP | T5-XXL | CLIP |
| 扩散空间 | 像素空间 | 像素空间 | 潜空间 |
| 开源 | ❌ | ❌ | ✅ |
| 可微调 | ❌ | ❌ | ✅ |
| 社区生态 | ❌ | ❌ | ✅ |
| 硬件要求 | API | API | 6GB VRAM |
4.3 SD成功的三大因素
1. 潜空间扩散:计算量降低48倍,消费级GPU可运行
2. 完全开源:模型权重、训练代码、推理代码全部开放
3. 社区生态:Civitai模型分享、LoRA/DreamBooth微调、插件生态
五、SDXL:从图像变体到神雕侠侣
5.1 SDXL架构创新
SD 1.5:单UNet,512×512
SDXL:双UNet + Refiner
Base模型 (1024×1024)
├─ 更大的UNet(2.6B参数 vs 860M)
├─ 双文本编码器(CLIP ViT-L + CLIP ViT-bigG)
└─ 更大的潜空间(128×128×4)
Refiner模型
└─ 在Base输出的基础上进一步精修高频细节
5.2 SDXL双文本编码器
# SDXL使用两个CLIP编码器
# CLIP ViT-L/14: 768维
# CLIP ViT-bigG/14: 1280维
# 拼接后:2048维文本嵌入
# 好处:
# 1. 更强的文本理解能力
# 2. 互补的编码信息
# 3. 对长文本更友好
5.3 SDXL vs SD 1.5 效果对比
| 维度 | SD 1.5 | SDXL |
|---|---|---|
| 默认分辨率 | 512×512 | 1024×1024 |
| 文字生成 | 几乎不可能 | 偶尔可以 |
| 人体结构 | 常有畸形 | 明显改善 |
| 构图能力 | 一般 | 更专业 |
| 显存需求 | 6GB | 12GB |
| 推理速度 | 快 | 慢约2-3倍 |
六、Midjourney:年入1亿美元的秘密
6.1 Midjourney技术推测
Midjourney从未公开架构,基于效果和公开信息推测:
1. 基础架构:大概率基于扩散模型(SD变体或自研)
2. 文本编码:可能使用更强的语言模型
3. 美学调优:大量人工美学标注数据
4. 后处理:可能有专门的增强管线
5. 模型蒸馏:多模型集成后蒸馏为单模型
6.2 Midjourney的商业模式
| 维度 | 策略 | 效果 |
|---|---|---|
| 交互方式 | Discord机器人 | 降低使用门槛 |
| 定价 | $10-60/月订阅 | 门槛低,用户量大 |
| 质量 | 默认参数即出好图 | 减少用户调参负担 |
| 社区 | Discord社区展示 | 自然增长,社交传播 |
| 迭代 | 快速版本更新 | v3→v4→v5→v6持续进化 |
6.3 Midjourney vs SD 效果差异
Midjourney优势:
- 默认美学质量更高(光影、构图、色彩)
- 对Prompt的理解更"聪明"(不需要大量质量词)
- 风格一致性更好
Stable Diffusion优势:
- 完全可控(参数、模型、插件)
- 可微调(LoRA/DreamBooth/ControlNet)
- 可商用(开源协议)
- 可本地部署(数据不出域)
七、DALL-E 3:用OpenAI的方式搞数据
7.1 DALL-E 3的核心创新
传统流程:用户Prompt → CLIP编码 → 扩散生成
DALL-E 3:用户Prompt → GPT-4重写 → 更详细描述 → 扩散生成
关键区别:用GPT-4把用户的简短描述扩展为详细的图像描述
7.2 数据策略
问题:训练数据中(描述, 图像)对的描述太简短
"一只猫" 对应一张高质量猫的照片
扩散模型学到的是"一只猫"→猫,但忽略了细节
DALL-E 3的解决方案:
1. 用强Caption模型给训练图像生成详细描述
"一只猫" → "一只橘色的猫坐在窗台上,阳光从左侧照入..."
2. 用(详细描述, 图像)重新训练扩散模型
3. 推理时用GPT-4把用户Prompt扩展为详细描述
结果:模型学到更丰富的文本-图像对应关系
7.3 从unCLIP到缝合怪方案
DALL-E 2:unCLIP架构(CLIP嵌入 → 扩散)
DALL-E 3:缝合怪(多个组件拼接)
推测架构:
GPT-4(Prompt重写)
→ 强文本编码器(可能是T5或自研)
→ 改进的扩散模型(可能借鉴SD/Imagen)
→ 多级超分辨率
→ 安全过滤器
7.4 DALL-E 3 vs SD vs MJ
| 维度 | DALL-E 3 | SDXL | MJ v6 |
|---|---|---|---|
| 文字理解 | ★★★★★ (GPT-4) | ★★★ | ★★★★ |
| 图中文字 | ★★★★★ | ★★ | ★★★★ |
| 可控性 | ★★ | ★★★★★ | ★★★ |
| 开源 | ❌ | ✅ | ❌ |
| 价格 | API计费 | 免费 | 订阅制 |
| 微调能力 | ❌ | ✅ | ❌ |
八、模型选择决策树
你需要什么?
│
├─ 快速出好图,不在乎控制
│ └─ Midjourney / DALL-E 3
│
├─ 完全控制 + 本地部署
│ ├─ 显存 ≥ 12GB → SDXL + ComfyUI
│ ├─ 显存 6-12GB → SD 1.5 + WebUI
│ └─ 显存 < 6GB → SD 1.5 + --lowvram 或 API
│
├─ 商业项目 + 数据安全
│ └─ SDXL 本地部署 + 自定义LoRA
│
├─ 角色一致性
│ └─ SD + LoRA/DreamBooth + ControlNet
│
└─ 视频/动画生成
└─ SD + AnimateDiff 或 Sora API
九、总结
AI绘画模型的竞争格局:
开源生态:Stable Diffusion / SDXL / SD3 / Flux
优势:可控、可微调、免费、社区
劣势:默认效果需调参
商业服务:Midjourney / DALL-E 3
优势:开箱即用、美学质量高
劣势:不可控、不可微调、持续付费
技术趋势:
1. 文本编码器越来越强(CLIP → T5 → GPT-4)
2. 骨干网络从UNet转向DiT
3. 数据质量比数据量更重要
4. 多模态融合(文+图+视频+3D)
下一篇:LoRA与ControlNet精准控制实战 — 动手训练LoRA、使用ControlNet实现精准构图控制。
本文对应课程进阶篇13-17讲及扩散模型方案篇26-27讲,总时长约1小时20分钟。
更多推荐



所有评论(0)