Stability AI 在 2026 年初发布了 Stable Diffusion 3.5,这是其开源图像生成模型系列的最新版本。与之前的版本相比,SD3.5 在多个维度上实现了质的飞跃,将开源图像生成的能力推向了前所未有的高度。
核心改进
SD3.5 采用了全新的 MMDiT-X(Multimodal Diffusion Transformer eXtended)架构。与 SD3 相比,新架构在处理复杂场景构图、多人互动和光影效果方面有了显著提升。特别值得一提的是,SD3.5 在文字渲染能力上取得了突破性进展——能够准确生成包含长文本段落的图像。
三个版本
SD3.5 发布了三个版本以满足不同场景的需求:
- SD3.5-Large— 8B 参数,最高质量,适合专业创作
- SD3.5-Medium— 2.6B 参数,质量与效率的最佳平衡
- SD3.5-Turbo— 经过蒸馏优化的快速推理版本,1-2 步即可生成高质量图像
提示词理解
SD3.5 在提示词遵循能力上实现了代际提升。它能够准确理解复杂的自然语言描述,包括指定物体的位置关系、颜色、材质、光照条件等细节。即使是非常抽象的概念描述,SD3.5 也能生成令人满意的视觉呈现。
「SD3.5 的提示词理解能力让我可以描述脑海中想象的场景,它几乎总是能准确呈现出来。这种一致性是之前任何开源模型都无法做到的。」— 数字艺术家评价
开源与许可证
Stability AI 延续了其开源传统,SD3.5 的所有模型权重均在 Hugging Face 上免费发布。许可证采用宽松的 Apache 2.0 协议,允许商业使用、修改和再分发。这为创业公司和独立开发者提供了强大的图像生成能力,无需支付昂贵的 API 费用。
社区生态
SD3.5 发布后,开源社区迅速响应。ComfyUI、Automatic1111 等主流图像生成工具在数天内即完成了对 SD3.5 的支持。社区训练的大量 LoRA 模型和 ControlNet 扩展也在持续涌现,进一步拓展了 SD3.5 的能力边界。
SD3.5 的发布标志着开源图像生成模型已经达到了专业级水准。无论是艺术创作、广告设计还是产品原型,SD3.5 都提供了一个强大且自由的创作工具。