基于 InstructPix2Pix 对 Stable Diffusion 进行指令微调
Hugging Face 探索了借鉴大语言模型 FLAN 的指令微调思路,结合 InstructPix2Pix 训练方案来微调 Stable Diffusion,使其能够遵循具体文本指令完成图像转换与底层处理。
推荐理由:作者结合 FLAN 的指令微调思路与 InstructPix2Pix 训练方案,展示了如何用指令引导扩散模型处理去雨和卡通化等特定图像任务。
技术方向
AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。
32 条精选近 30 天 1 条共收录 51 条
Hugging Face 探索了借鉴大语言模型 FLAN 的指令微调思路,结合 InstructPix2Pix 训练方案来微调 Stable Diffusion,使其能够遵循具体文本指令完成图像转换与底层处理。
推荐理由:作者结合 FLAN 的指令微调思路与 InstructPix2Pix 训练方案,展示了如何用指令引导扩散模型处理去雨和卡通化等特定图像任务。
Hugging Face 介绍了利用 diffusers 在仅有 15GB 显存的免费版 Google Colab 上运行 DeepFloyd IF 模型的方法。方案将 T5-XXL 文本编码器进行 8-bit 量化,并在文生图、图像变体与图像修复流程中按阶段单独加载与释放各级 UNet 组件,从而突破显存限制生成 1024x1024 图像。
推荐理由:原文给出了 8-bit 量化配合阶段性按需加载与显存释放的具体实现,为在有限显存设备上运行超 10B 扩散模型提供了工程参考。
Hugging Face Diffusers 库宣布支持 ControlNet。当前材料仅包含标题,正文未提供更多具体更新细节。
Hugging Face 发布了在 Apple Silicon 上通过 Core ML 运行 Stable Diffusion 的实践教程,并在 Hugging Face Hub 上直接提供转换后的模型权重。
推荐理由:原文给出了不同注意力实现与计算单元的选择策略,读者可据此在苹果设备上完成端侧图像生成部署。
Hugging Face 发布了基于 Diffusers 库使用 Dreambooth 微调 Stable Diffusion 的调优实践与参数建议。测试表明人脸训练更易过拟合,需采用 1e-6 左右的低学习率、800 至 1200 步训练并开启先验保留;同时微调文本编码器可大幅改善图像真实度与复杂提示词理解。
推荐理由:文章给出了针对人脸与物体的学习率、步数调优数据,并验证了微调文本编码器对画面质量的关键提升,适合作为定制扩散模型的实操参考。
Hugging Face 在 Diffusers 0.5.1 中加入对 JAX/Flax 的支持,允许用户在 Google TPU 上快速运行 Stable Diffusion 推理。利用 TPU 包含 8 个加速核心的特性,结合 jax.pmap 和 JIT 编译,系统可将参数与提示词分片后并行生成 8 张图片;在 TPU v2-8 上单次推理测试耗时约 7 秒。
推荐理由:原文给出了基于 JAX/Flax 在 TPU 上并行运行 Stable Diffusion 的完整步骤与测速数据,便于开发者迁移到分布式推理环境。
rinna 发布针对日语文化微调的文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本本土文化意象的图像。该模型基于约 1 亿张带有日语标注的图像进行训练,采用两阶段方法先训练专属日语文本编码器再与潜在扩散模型联合微调,相关权重和代码已在 Hugging Face 与 GitHub 开源。
推荐理由:原文详细拆解了在小规模语料下将英文扩散模型迁移至本土语言的两阶段微调方案,为特定语种文生图适配提供了可复用的工程参考。
OpenAI 宣布 DALL·E 正式取消候补名单限制,新用户无需排队即可直接开始创作。官方表示,实际部署中积累的经验以及安全系统的改进使得更大范围的开放成为可能。
Hugging Face 发布 Diffusers 0.3 版本,正式推出图生图(Image-to-Image)、Textual Inversion 定制和实验性 Inpainting 修复流水线。
推荐理由:该版本降低了扩散模型的显存门槛并打通了苹果芯片推理,方便开发者在本地设备快速部署图像生成流水线。
OpenAI 为 DALL·E 推出 Outpainting 功能。该功能允许用户在原有画面基础上向外延伸扩展,生成任意尺寸的图像以展现更宏大的视觉内容。
Hugging Face 官方发布了使用 Diffusers 库运行 Stable Diffusion 的实践指南,详解了潜空间扩散模型的工作原理与底层架构。文章阐明了 VAE、U-Net 和 CLIP 文本编码器的协同机制,并提供了从常规开箱即用调用到手动编写自定义去噪循环、替换调度器的完整代码实现。
推荐理由:文章不仅提供了开箱即用的推理代码,还完整拆解了潜扩散模型各模块,方便读者按需替换调度器或定制生成管线。
Hugging Face 官方发布去噪扩散概率模型(DDPM)的带注释实战教程,系统讲解离散时间扩散模型的数学原理并提供完整的 PyTorch 逐步实现。教程基于 U-Net、正弦位置嵌入和注意力机制构建噪声预测网络,详细演示了前向加噪过程、均值重参数化损失计算、Fashion-MNIST 训练与反向去噪采样流程。
推荐理由:原文完整拆解了 DDPM 的数学原理与 PyTorch 核心实现,读者可以据此掌握扩散模型的加噪去噪机制与训练全流程。