当前位置:   article > 正文

记一次:Datawhale AI夏令营-第四期-魔搭-AIGC-Task02

记一次:Datawhale AI夏令营-第四期-魔搭-AIGC-Task02













                2.1. 安装和卸载依赖包

                2.2. 加载数据集

                2.3. 数据预处理

                2.4. 使用 Data-Juicer 进行数据处理

                2. 5. 保存处理好的数据

                2.6. 训练模型

                2.7. 图像生成

                2.8. 合并图像




AIGC(AI-Generated Content)笔者单词不好,百度翻译一下就是:AI产生内容。那么也就是我们用AI生成一些东西。产生什么内容很广泛。然后我们这次使用的文生图其实是AIGC的一个小模块,那么我们学习不也是由特例延伸到泛例嘛,所以文生图弄明白了之后在泛化扩展AI产生其它内容。




2015年,谷歌推出了“深梦”(Deep Dream)图像生成工具,类似一个高级滤镜,可以基于给定的图片生成梦幻版图片,画重点谷歌“深梦”工具

2021 年 1 月 OpenAI 推出DALL-E模型能直接从文本提示“按需创造”风格多样的图形设计





AI味:AI生成的图片和实际生活场景/艺术家创作的绘画/摄影/三维作品 相比,存在强烈的违和感,或是细节处理,或是画面逻辑性存在问题,一言就能被看出是“AI出品”,目前大部分的模型,已经具备了去除 “AI味” 的能力。




Kolors(可图)模型(点击即可跳转魔搭模型介绍页) 是快手开源的文本到图像生成模型,该模型具有对英语和汉语的深刻理解,并能够生成高质量、逼真的图像。





过去文生图主要以 SD 系列基础模型为主,仅支持英文的prompt,但可图是支持中文的文生图模型,文生图的prompt格式较为固定,魔搭社区还开源了专门的各种风格的可图优质咒语书(点击即可跳转),可以针对600+种不同风格,完善prompt,生成各种风格图片,可以在我们的学习当中使用



创意海报生成 工具,早已在代码中固定了相应的文字位置和对应的字体,才能进行相应的生成,且大概率是进行了两个步骤——

  • 一个步骤是AI生成背景,

  • 另一个步骤是通过代码将对应的文字显示到对应位置,

  • 然后渲染,合成图片,给到我们。



  1. git lfs install
  2. git clone https://www.modelscope.cn/datasets/maochase/kolors.git


安装Git LFS,简单说就是使用git处理大文件的能力













  1. !pip install simple-aesthetics-predictor
  2. !pip install -v -e data-juicer
  3. !pip uninstall pytorch-lightning -y
  4. !pip install peft lightning pandas torchvision
  5. !pip install -e DiffSynth-Studio
  6. from modelscope.msdatasets import MsDataset
  7. ds = MsDataset.load(
  8. 'AI-ModelScope/lowres_anime',
  9. subset_name='default',
  10. split='train',
  11. cache_dir="/mnt/workspace/kolors/data"
  12. )
  13. import json, os
  14. from data_juicer.utils.mm_utils import SpecialTokens
  15. from tqdm import tqdm
  16. os.makedirs("./data/lora_dataset/train", exist_ok=True)
  17. os.makedirs("./data/data-juicer/input", exist_ok=True)
  18. with open("./data/data-juicer/input/metadata.jsonl", "w") as f:
  19. for data_id, data in enumerate(tqdm(ds)):
  20. image = data["image"].convert("RGB")
  21. image.save(f"/mnt/workspace/kolors/data/lora_dataset/train/{data_id}.jpg")
  22. metadata = {"text": "二次元", "image": [f"/mnt/workspace/kolors/data/lora_dataset/train/{data_id}.jpg"]}
  23. f.write(json.dumps(metadata))
  24. f.write("\n")
  25. data_juicer_config = """
  26. # global parameters
  27. project_name: 'data-process'
  28. dataset_path: './data/data-juicer/input/metadata.jsonl' # path to your dataset directory or file
  29. np: 4 # number of subprocess to process your dataset
  30. text_keys: 'text'
  31. image_key: 'image'
  32. image_special_token: '<__dj__image>'
  33. export_path: './data/data-juicer/output/result.jsonl'
  34. # process schedule
  35. # a list of several process operators with their arguments
  36. process:
  37. - image_shape_filter:
  38. min_width: 1024
  39. min_height: 1024
  40. any_or_all: any
  41. - image_aspect_ratio_filter:
  42. min_ratio: 0.5
  43. max_ratio: 2.0
  44. any_or_all: any
  45. """
  46. with open("data/data-juicer/data_juicer_config.yaml", "w") as file:
  47. file.write(data_juicer_config.strip())
  48. !dj-process --config data/data-juicer/data_juicer_config.yaml
  49. import pandas as pd
  50. import os, json
  51. from PIL import Image
  52. from tqdm import tqdm
  53. texts, file_names = [], []
  54. os.makedirs("./data/data-juicer/output/images", exist_ok=True)
  55. with open("./data/data-juicer/output/result.jsonl", "r") as f:
  56. for line in tqdm(f):
  57. metadata = json.loads(line)
  58. texts.append(metadata["text"])
  59. file_names.append(metadata["image"][0])
  60. df = pd.DataFrame({"text": texts, "file_name": file_names})
  61. df.to_csv("./data/data-juicer/output/result.csv", index=False)
  62. df
  63. from transformers import CLIPProcessor, CLIPModel
  64. import torch
  65. model = CLIPModel.from_pretrained("openai/clip-vit-base-patch32")
  66. processor = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch32")
  67. images = [Image.open(img_path) for img_path in df["file_name"]]
  68. inputs = processor(text=df["text"].tolist(), images=images, return_tensors="pt", padding=True)
  69. outputs = model(**inputs)
  70. logits_per_image = outputs.logits_per_image # this is the image-text similarity score
  71. probs = logits_per_image.softmax(dim=1) # we can take the softmax to get the probabilities
  72. probs
  73. from torch.utils.data import Dataset, DataLoader
  74. class CustomDataset(Dataset):
  75. def __init__(self, df, processor):
  76. self.texts = df["text"].tolist()
  77. self.images = [Image.open(img_path) for img_path in df["file_name"]]
  78. self.processor = processor
  79. def __len__(self):
  80. return len(self.texts)
  81. def __getitem__(self, idx):
  82. inputs = self.processor(text=self.texts[idx], images=self.images[idx], return_tensors="pt", padding=True)
  83. return inputs
  84. dataset = CustomDataset(df, processor)
  85. dataloader = DataLoader(dataset, batch_size=8)
  86. for batch in dataloader:
  87. outputs = model(**batch)
  88. logits_per_image = outputs.logits_per_image
  89. probs = logits_per_image.softmax(dim=1)
  90. print(probs)
  91. import torch
  92. from diffusers import StableDiffusionPipeline
  93. torch.manual_seed(1)
  94. pipe = StableDiffusionPipeline.from_pretrained("CompVis/stable-diffusion-v-1-4", torch_dtype=torch.float16)
  95. pipe = pipe.to("cuda")
  96. prompt = "二次元,一个紫色长发小女孩穿着粉色吊带漏肩连衣裙,在练习室练习唱歌,手持话筒"
  97. negative_prompt = "丑陋、变形、嘈杂、模糊、低对比度"
  98. guidance_scale = 4
  99. num_inference_steps = 50
  100. image = pipe(
  101. prompt=prompt,
  102. negative_prompt=negative_prompt,
  103. guidance_scale=guidance_scale,
  104. num_inference_steps=num_inference_steps,
  105. height=1024,
  106. width=1024,
  107. ).images[0]
  108. image.save("example_image.png")
  109. image
  110. from PIL import Image
  111. torch.manual_seed(1)
  112. image = pipe(
  113. prompt="二次元,日系动漫,演唱会的观众席,人山人海,一个紫色短发小女孩穿着粉色吊带漏肩连衣裙坐在演唱会的观众席,舞台上衣着华丽的歌星们在唱歌",
  114. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  115. cfg_scale=4,
  116. num_inference_steps=50, height=1024, width=1024,
  117. )
  118. image.save("1.jpg")
  119. torch.manual_seed(1)
  120. image = pipe(
  121. prompt="二次元,一个紫色短发小女孩穿着粉色吊带漏肩连衣裙坐在演唱会的观众席,露出憧憬的神情",
  122. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度,色情擦边",
  123. cfg_scale=4,
  124. num_inference_steps=50, height=1024, width=1024,
  125. )
  126. image.save("2.jpg")
  127. torch.manual_seed(2)
  128. image = pipe(
  129. prompt="二次元,一个紫色短发小女孩穿着粉色吊带漏肩连衣裙坐在演唱会的观众席,露出憧憬的神情",
  130. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度,色情擦边",
  131. cfg_scale=4,
  132. num_inference_steps=50, height=1024, width=1024,
  133. )
  134. image.save("3.jpg")
  135. torch.manual_seed(5)
  136. image = pipe(
  137. prompt="二次元,一个紫色短发小女孩穿着粉色吊带漏肩连衣裙,对着流星许愿,闭着眼睛,十指交叉,侧面",
  138. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度,扭曲的手指,多余的手指",
  139. cfg_scale=4,
  140. num_inference_steps=50, height=1024, width=1024,
  141. )
  142. image.save("4.jpg")
  143. torch.manual_seed(0)
  144. image = pipe(
  145. prompt="二次元,一个紫色中等长度头发小女孩穿着粉色吊带漏肩连衣裙,在练习室练习唱歌",
  146. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  147. cfg_scale=4,
  148. num_inference_steps=50, height=1024, width=1024,
  149. )
  150. image.save("5.jpg")
  151. torch.manual_seed(1)
  152. image = pipe(
  153. prompt="二次元,一个紫色长发小女孩穿着粉色吊带漏肩连衣裙,在练习室练习唱歌,手持话筒",
  154. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  155. cfg_scale=4,
  156. num_inference_steps=50, height=1024, width=1024,
  157. )
  158. image.save("6.jpg")
  159. torch.manual_seed(7)
  160. image = pipe(
  161. prompt="二次元,紫色长发少女,穿着黑色连衣裙,试衣间,心情忐忑",
  162. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  163. cfg_scale=4,
  164. num_inference_steps=50, height=1024, width=1024,
  165. )
  166. image.save("7.jpg")
  167. torch.manual_seed(0)
  168. image = pipe(
  169. prompt="二次元,紫色长发少女,穿着黑色礼服,连衣裙,在台上唱歌",
  170. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  171. cfg_scale=4,
  172. num_inference_steps=50, height=1024, width=1024,
  173. )
  174. image.save("8.jpg")
  175. import numpy as np
  176. from PIL import Image
  177. images = [np.array(Image.open(f"{i}.jpg")) for i in range(1, 9)]
  178. image = np.concatenate([
  179. np.concatenate(images[0:2], axis=1),
  180. np.concatenate(images[2:4], axis=1),
  181. np.concatenate(images[4:6], axis=1),
  182. np.concatenate(images[6:8], axis=1),
  183. ], axis=0)
  184. image = Image.fromarray(image).resize((1024, 2048))
  185. image


2.1. 安装和卸载依赖包

这个没什么可说的,写代码的也得需要导包相关的环境吧?使用 !pip 命令来安装或卸载 Python 包

2.2. 加载数据集

  1. from modelscope.msdatasets import MsDataset
  2. ds = MsDataset.load(
  3. 'AI-ModelScope/lowres_anime',
  4. subset_name='default',
  5. split='train',
  6. cache_dir="/mnt/workspace/kolors/data"
  7. )

使用 ModelScope 的 MsDataset 类加载名为 AI-ModelScope/lowres_anime 的数据集,并指定子集名称为 default 和分割为 train,缓存目录设置为 /mnt/workspace/kolors/data

2.3. 数据预处理

  1. import json, os
  2. from data_juicer.utils.mm_utils import SpecialTokens
  3. from tqdm import tqdm
  4. os.makedirs("./data/lora_dataset/train", exist_ok=True)
  5. os.makedirs("./data/data-juicer/input", exist_ok=True)
  6. with open("./data/data-juicer/input/metadata.jsonl", "w") as f:
  7. for data_id, data in enumerate(tqdm(ds)):
  8. image = data["image"].convert("RGB")
  9. image.save(f"/mnt/workspace/kolors/data/lora_dataset/train/{data_id}.jpg")
  10. metadata = {"text": "二次元", "image": [f"/mnt/workspace/kolors/data/lora_dataset/train/{data_id}.jpg"]}
  11. f.write(json.dumps(metadata))
  12. f.write("\n")

- 将数据集中的图像转换为 RGB 模式,并保存到指定目录。

- 创建包含图像路径和文本描述的元数据文件 metadata.jsonl。

- 编写并保存 data_juicer_config.yaml 配置文件,用于后续的数据过滤和处理。

2.4. 使用 Data-Juicer 进行数据处理

  1. data_juicer_config = """
  2. # global parameters
  3. project_name: 'data-process'
  4. dataset_path: './data/data-juicer/input/metadata.jsonl' # path to your dataset directory or file
  5. np: 4 # number of subprocess to process your dataset
  6. text_keys: 'text'
  7. image_key: 'image'
  8. image_special_token: '<__dj__image>'
  9. export_path: './data/data-juicer/output/result.jsonl'
  10. # process schedule
  11. # a list of several process operators with their arguments
  12. process:
  13. - image_shape_filter:
  14. min_width: 1024
  15. min_height: 1024
  16. any_or_all: any
  17. - image_aspect_ratio_filter:
  18. min_ratio: 0.5
  19. max_ratio: 2.0
  20. any_or_all: any
  21. """
  22. with open("data/data-juicer/data_juicer_config.yaml", "w") as file:
  23. file.write(data_juicer_config.strip())
  24. !dj-process --config data/data-juicer/data_juicer_config.yaml

使用 dj-process 命令根据配置文件对数据进行过滤和处理,生成 result.jsonl 文件。

2. 5.保存处理好的数据

  1. import pandas as pd
  2. import os, json
  3. from PIL import Image
  4. from tqdm import tqdm
  5. texts, file_names = [], []
  6. os.makedirs("./data/lora_dataset_processed/train", exist_ok=True)
  7. with open("./data/data-juicer/output/result.jsonl", "r") as file:
  8. for data_id, data in enumerate(tqdm(file.readlines())):
  9. data = json.loads(data)
  10. text = data["text"]
  11. texts.append(text)
  12. image = Image.open(data["image"][0])
  13. image_path = f"./data/lora_dataset_processed/train/{data_id}.jpg"
  14. image.save(image_path)
  15. file_names.append(f"{data_id}.jpg")
  16. data_frame = pd.DataFrame()
  17. data_frame["file_name"] = file_names
  18. data_frame["text"] = texts
  19. data_frame.to_csv("./data/lora_dataset_processed/train/metadata.csv", index=False, encoding="utf-8-sig")
  20. data_frame

2.6. 训练模型


  1. from diffsynth import download_models
  2. download_models(["Kolors", "SDXL-vae-fp16-fix"])


!python DiffSynth-Studio/examples/train/kolors/train_kolors_lora.py -h



  1. 在训练命令中填入 --modelscope_model_id xxxxx 以及 --modelscope_access_token xxxxx 后,训练程序会在结束时自动上传模型到 ModelScope
  2. 部分参数可根据实际需求调整,例如 lora_rank 可以控制 LoRA 模型的参数量
  1. import os
  2. cmd = """
  3. python DiffSynth-Studio/examples/train/kolors/train_kolors_lora.py \
  4. --pretrained_unet_path models/kolors/Kolors/unet/diffusion_pytorch_model.safetensors \
  5. --pretrained_text_encoder_path models/kolors/Kolors/text_encoder \
  6. --pretrained_fp16_vae_path models/sdxl-vae-fp16-fix/diffusion_pytorch_model.safetensors \
  7. --lora_rank 16 \
  8. --lora_alpha 4.0 \
  9. --dataset_path data/lora_dataset_processed \
  10. --output_path ./models \
  11. --max_epochs 1 \
  12. --center_crop \
  13. --use_gradient_checkpointing \
  14. --precision "16-mixed"
  15. """.strip()
  16. os.system(cmd)


  1. from diffsynth import ModelManager, SDXLImagePipeline
  2. from peft import LoraConfig, inject_adapter_in_model
  3. import torch
  4. def load_lora(model, lora_rank, lora_alpha, lora_path):
  5. lora_config = LoraConfig(
  6. r=lora_rank,
  7. lora_alpha=lora_alpha,
  8. init_lora_weights="gaussian",
  9. target_modules=["to_q", "to_k", "to_v", "to_out"],
  10. )
  11. model = inject_adapter_in_model(lora_config, model)
  12. state_dict = torch.load(lora_path, map_location="cpu")
  13. model.load_state_dict(state_dict, strict=False)
  14. return model
  15. # Load models
  16. model_manager = ModelManager(torch_dtype=torch.float16, device="cuda",
  17. file_path_list=[
  18. "models/kolors/Kolors/text_encoder",
  19. "models/kolors/Kolors/unet/diffusion_pytorch_model.safetensors",
  20. "models/kolors/Kolors/vae/diffusion_pytorch_model.safetensors"
  21. ])
  22. pipe = SDXLImagePipeline.from_model_manager(model_manager)
  23. # Load LoRA
  24. pipe.unet = load_lora(
  25. pipe.unet,
  26. lora_rank=16, # This parameter should be consistent with that in your training script.
  27. lora_alpha=2.0, # lora_alpha can control the weight of LoRA.
  28. lora_path="models/lightning_logs/version_0/checkpoints/epoch=0-step=500.ckpt"
  29. )

2.7. 图像生成

  1. torch.manual_seed(0)
  2. image = pipe(
  3. prompt="二次元,一个大波浪小女孩,在家中阳台上坐着,外面下着雨,双手托着腮,很无聊,全身,黑丝",
  4. negative_prompt="丑陋、变形、嘈杂、模糊、低对比度",
  5. cfg_scale=4,
  6. num_inference_steps=50, height=1024, width=1024,
  7. )
  8. image.save("1.jpg")


- 设置正向提示词,反向提示词,执行次数,图片尺寸

- 设置随机种子,控制图片是否可以重复生成,并将图像保存为 .jpg 文件。

2.8. 合并图像

  1. import numpy as np
  2. from PIL import Image
  3. images = [np.array(Image.open(f"{i}.jpg")) for i in range(1, 9)]
  4. image = np.concatenate([
  5. np.concatenate(images[0:2], axis=1),
  6. np.concatenate(images[2:4], axis=1),
  7. np.concatenate(images[4:6], axis=1),
  8. np.concatenate(images[6:8], axis=1),
  9. ], axis=0)
  10. image = Image.fromarray(image).resize((1024, 2048))
  11. image

- 最后,将生成的多个图像合并成一个大图像,并调整大小。


三、Scepter与WebUI 可视化生图




