跳到正文

技术方向

图像生成 最新动态

AI 画图的最前线:文生图模型迭代、图像编辑能力与创作工具生态的全部动态。

32 条精选近 30 天 1 条共收录 51 条

更新

精选归档 · 第 2 页

5月23日周二第 21–32 条
  1. Hugging Face Blog60

    基于 InstructPix2Pix 对 Stable Diffusion 进行指令微调

    Hugging Face 探索了借鉴大语言模型 FLAN 的指令微调思路,结合 InstructPix2Pix 训练方案来微调 Stable Diffusion,使其能够遵循具体文本指令完成图像转换与底层处理。

    推荐理由:作者结合 FLAN 的指令微调思路与 InstructPix2Pix 训练方案,展示了如何用指令引导扩散模型处理去雨和卡通化等特定图像任务。

4月26日周三
  1. Hugging Face Blog75

    如何在免费版 Google Colab 上使用 diffusers 运行 DeepFloyd IF

    Hugging Face 介绍了利用 diffusers 在仅有 15GB 显存的免费版 Google Colab 上运行 DeepFloyd IF 模型的方法。方案将 T5-XXL 文本编码器进行 8-bit 量化,并在文生图、图像变体与图像修复流程中按阶段单独加载与释放各级 UNet 组件,从而突破显存限制生成 1024x1024 图像。

    推荐理由:原文给出了 8-bit 量化配合阶段性按需加载与显存释放的具体实现,为在有限显存设备上运行超 10B 扩散模型提供了工程参考。

3月3日周五
12月1日周四
11月7日周一
  1. Hugging Face Blog81

    使用 Diffusers 和 Dreambooth 训练 Stable Diffusion 的调优指南

    Hugging Face 发布了基于 Diffusers 库使用 Dreambooth 微调 Stable Diffusion 的调优实践与参数建议。测试表明人脸训练更易过拟合,需采用 1e-6 左右的低学习率、800 至 1200 步训练并开启先验保留;同时微调文本编码器可大幅改善图像真实度与复杂提示词理解。

    推荐理由:文章给出了针对人脸与物体的学习率、步数调优数据,并验证了微调文本编码器对画面质量的关键提升,适合作为定制扩散模型的实操参考。

10月13日周四
  1. Hugging Face Blog63

    Hugging Face Diffusers 支持 JAX/Flax 实现 Stable Diffusion TPU 并行推理

    Hugging Face 在 Diffusers 0.5.1 中加入对 JAX/Flax 的支持,允许用户在 Google TPU 上快速运行 Stable Diffusion 推理。利用 TPU 包含 8 个加速核心的特性,结合 jax.pmap 和 JIT 编译,系统可将参数与提示词分片后并行生成 8 张图片;在 TPU v2-8 上单次推理测试耗时约 7 秒。

    推荐理由:原文给出了基于 JAX/Flax 在 TPU 上并行运行 Stable Diffusion 的完整步骤与测速数据,便于开发者迁移到分布式推理环境。

10月5日周三
  1. Hugging Face Blog62

    rinna 发布日语微调模型 Japanese Stable Diffusion

    rinna 发布针对日语文化微调的文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本本土文化意象的图像。该模型基于约 1 亿张带有日语标注的图像进行训练,采用两阶段方法先训练专属日语文本编码器再与潜在扩散模型联合微调,相关权重和代码已在 Hugging Face 与 GitHub 开源。

    推荐理由:原文详细拆解了在小规模语料下将英文扩散模型迁移至本土语言的两阶段微调方案,为特定语种文生图适配提供了可复用的工程参考。

9月28日周三
9月12日周一
8月31日周三
8月22日周一
  1. Hugging Face Blog95

    基于 Diffusers 库运行与定制 Stable Diffusion 完整指南

    Hugging Face 官方发布了使用 Diffusers 库运行 Stable Diffusion 的实践指南,详解了潜空间扩散模型的工作原理与底层架构。文章阐明了 VAE、U-Net 和 CLIP 文本编码器的协同机制,并提供了从常规开箱即用调用到手动编写自定义去噪循环、替换调度器的完整代码实现。

    推荐理由:文章不仅提供了开箱即用的推理代码,还完整拆解了潜扩散模型各模块,方便读者按需替换调度器或定制生成管线。

6月7日周二
  1. Hugging Face Blog71

    带注释的扩散模型:DDPM 理论与 PyTorch 逐步实现

    Hugging Face 官方发布去噪扩散概率模型(DDPM)的带注释实战教程,系统讲解离散时间扩散模型的数学原理并提供完整的 PyTorch 逐步实现。教程基于 U-Net、正弦位置嵌入和注意力机制构建噪声预测网络,详细演示了前向加噪过程、均值重参数化损失计算、Fashion-MNIST 训练与反向去噪采样流程。

    推荐理由:原文完整拆解了 DDPM 的数学原理与 PyTorch 核心实现,读者可以据此掌握扩散模型的加噪去噪机制与训练全流程。