확산 모델로 이미지 편집

Hugging Face로 배우는 멀티모달 모델

James Chapman

Curriculum Manager, DataCamp

Diffusers

노이즈에서 이미지를 생성하는 확산 모델 단계

  • 노이즈를 이미지로 매핑하도록 학습됨
  • CLIP + Diffusion → 2가지 조건부 생성
    • 생성: 텍스트 → 이미지
    • 수정: 텍스트+이미지 → 이미지
1 https://huggingface.co/docs/diffusers
Hugging Face로 배우는 멀티모달 모델

맞춤형 이미지 편집

ControlNet: 이미지·텍스트 기반 조건부 생성

캐니 필터와 ControlNet을 활용한 맞춤형 이미지 편집 흐름도

1 https://stable-diffusion-art.com/controlnet/
Hugging Face로 배우는 멀티모달 모델

맞춤형 이미지 편집

from diffusers.utils import load_image

image = load_image("http://301.nz/o81bf")

import cv2 from PIL import Image import numpy as np image = cv2.Canny(np.array(image), 100, 200)
image = image[:, :, None] image = np.concatenate([image, image, image], axis=2)

모나리자 이미지

Hugging Face로 배우는 멀티모달 모델

맞춤형 이미지 편집

from diffusers.utils import load_image

image = load_image("http://301.nz/o81bf")

import cv2
from PIL import Image
import numpy as np

image = cv2.Canny(np.array(image), 100, 200)
image = image[:, :, None]
image = np.concatenate([image, image, image], 
                       axis=2)
canny_image = Image.fromarray(image)

모나리자와 캐니 필터 적용 이미지

Hugging Face로 배우는 멀티모달 모델

맞춤형 이미지 편집

from diffusers import StableDiffusionControlNetPipeline
from diffusers import ControlNetModel
import torch

controlnet = ControlNetModel.from_pretrained("lllyasviel/sd-controlnet-canny", 
                                             torch_dtype=torch.float16)


pipe = StableDiffusionControlNetPipeline.from_pretrained( "runwayml/stable-diffusion-v1-5", controlnet=controlnet, torch_dtype=torch.float16 )
pipe = pipe.to("cuda")
Hugging Face로 배우는 멀티모달 모델

맞춤형 이미지 편집

prompt = ["Albert Einstein, 
          best quality, 
          extremely detailed"]

generator = [ torch.Generator(device="cuda").manual_seed(2)]
output = pipe( prompt, canny_image, negative_prompt=["monochrome, lowres, bad anatomy, worst quality, low quality"], generator=generator, num_inference_steps=20)

모나리자 포즈의 알베르트 아인슈타인

Hugging Face로 배우는 멀티모달 모델

이미지 인페인팅

  • 특정 영역에만 새 콘텐츠 생성

마스크 없는 모나리자

Hugging Face로 배우는 멀티모달 모델

이미지 인페인팅

  • 특정 영역에만 새 콘텐츠 생성
  • 이진 마스크: 흰색(1), 검은색(0)
  • 마스크는 세그멘테이션 또는 사용자 지정(예: InpaintingMask-Generation)

모나리자와 마스크

Hugging Face로 배우는 멀티모달 모델

이미지 인페인팅

from diffusers import StableDiffusionControlNetInpaintPipeline, ControlNetModel


controlnet = ControlNetModel.from_pretrained("lllyasviel/control_v11p_sd15_inpaint", torch_dtype=torch.float16, use_safetensors=True)
pipe = StableDiffusionControlNetInpaintPipeline.from_pretrained( "stable-diffusion-v1-5/stable-diffusion-v1-5", controlnet=controlnet, torch_dtype=torch.float16, use_safetensors=True )
Hugging Face로 배우는 멀티모달 모델

이미지 인페인팅

def make_inpaint_condition(image, image_mask):
    image = np.array(image.convert("RGB")).astype(np.float32) / 255.0
    image_mask = np.array(image_mask.convert("L")).astype(np.float32) / 255.0


image[image_mask > 0.5] = -1.0
image = np.expand_dims(image, 0).transpose(0, 3, 1, 2) image = torch.from_numpy(image) return image control_image = make_inpaint_condition(init_image, mask_image)
Hugging Face로 배우는 멀티모달 모델

이미지 인페인팅

output = pipe(
    "The head of the mona lisa in the 
  same style and quality as the original
  mona lisa with a clear smile and a 
  slightly smaller head size",

num_inference_steps=40,
eta=1.0,
image=init_image, mask_image=mask_image, control_image=control_image, ).images[0]

미소 짓는 모나리자

Hugging Face로 배우는 멀티모달 모델

연습해 봅시다!

Hugging Face로 배우는 멀티모달 모델

Preparing Video For Download...