Semantic segmentation ด้วย U-Net

Deep Learning สำหรับภาพด้วย PyTorch

Michal Oleszak

Machine Learning Engineer

Semantic segmentation

  • ไม่แยกความแตกต่างระหว่าง instance ต่าง ๆ ของคลาสเดียวกัน
  • เหมาะกับงานวิเคราะห์ภาพทางการแพทย์หรือภาพถ่ายดาวเทียม
  • สถาปัตยกรรมยอดนิยม: U-Net
Deep Learning สำหรับภาพด้วย PyTorch

สถาปัตยกรรม U-Net

ไดอะแกรมสถาปัตยกรรม U-Net

Encoder:

  • เลเยอร์ convolutional และ pooling
  • Downsampling: ลดมิติเชิงพื้นที่พร้อมเพิ่ม depth
Deep Learning สำหรับภาพด้วย PyTorch

สถาปัตยกรรม U-Net

ไดอะแกรมสถาปัตยกรรม U-Net

Decoder:

  • สมมาตรกับ encoder
  • Upsample feature map ด้วย transposed convolution
Deep Learning สำหรับภาพด้วย PyTorch

สถาปัตยกรรม U-Net

ไดอะแกรมสถาปัตยกรรม U-Net

Skip connections:

  • เชื่อมต่อจาก encoder ไปยัง decoder
  • รักษารายละเอียดที่สูญหายระหว่าง downsampling
Deep Learning สำหรับภาพด้วย PyTorch

Transposed convolution

ไดอะแกรม transposed convolution

  • Upsample feature map ใน decoder: เพิ่ม height และ width พร้อมลด depth
  • กระบวนการ transposed convolution:
    1. แทรกศูนย์ระหว่างหรือรอบ ๆ input feature map
    2. ทำ convolution ปกติบน input ที่เติม zero-padding แล้ว
Deep Learning สำหรับภาพด้วย PyTorch

Transposed convolution ใน PyTorch

import torch.nn as nn

upsample = nn.ConvTranspose2d(
    in_channels=in_channels,
    out_channels=out_channels,
    kernel_size=2,
    stride=2,
)
Deep Learning สำหรับภาพด้วย PyTorch

U-Net: การกำหนดเลเยอร์

class UNet(nn.Module):
    def __init__(self, in_channels, out_channels):
        super(UNet, self).__init__()


self.enc1 = self.conv_block(in_channels, 64) self.enc2 = self.conv_block(64, 128) self.enc3 = self.conv_block(128, 256) self.enc4 = self.conv_block(256, 512) self.pool = nn.MaxPool2d(kernel_size=2, stride=2)
self.upconv3 = nn.ConvTranspose2d(512, 256, kernel_size=2, stride=2) self.upconv2 = nn.ConvTranspose2d(256, 128, kernel_size=2, stride=2) self.upconv1 = nn.ConvTranspose2d(128, 64, kernel_size=2, stride=2)
self.dec1 = self.conv_block(512, 256) self.dec2 = self.conv_block(256, 128) self.dec3 = self.conv_block(128, 64) self.out = nn.Conv2d(64, out_channels, kernel_size=1)
  • Encoder:
    • Convolutional blocks
      def conv_block(self, in_channels, out_channels):
      return nn.Sequential(
        nn.Conv2d(in_channels, out_channels),
        nn.ReLU(inplace=True),
        nn.Conv2d(out_channels, out_channels),
        nn.ReLU(inplace=True)
      )
      
    • Pooling layer
  • Decoder:
    • Transposed convolutions
    • Convolutional blocks
Deep Learning สำหรับภาพด้วย PyTorch

U-Net: forward method

def forward(self, x):

x1 = self.enc1(x) x2 = self.enc2(self.pool(x1)) x3 = self.enc3(self.pool(x2)) x4 = self.enc4(self.pool(x3))
x = self.upconv3(x4)
x = torch.cat([x, x3], dim=1)
x = self.dec1(x)
x = self.upconv2(x) x = torch.cat([x, x2], dim=1) x = self.dec2(x) x = self.upconv1(x) x = torch.cat([x, x1], dim=1) x = self.dec3(x)
return self.out(x)
  • ส่ง input ผ่าน convolutional blocks และ pooling layers ของ encoder
  • Decoder และ skip connections:
    • ส่ง encoded input ผ่าน transposed convolution
    • เชื่อมต่อกับ output ของ encoder ที่สอดคล้องกัน
    • ส่งผ่าน convolution block
    • ทำซ้ำสำหรับทุกขั้นตอนของ decoder
  • คืนค่า output ของ decoder ขั้นสุดท้าย
Deep Learning สำหรับภาพด้วย PyTorch

การรัน inference

model = UNet()
model.eval()


image = Image.open("car.jpg") transform = transforms.Compose([transforms.ToTensor()]) image_tensor = transform(image).unsqueeze(0)
with torch.no_grad(): prediction = model(image_tensor).squeeze(0)
plt.imshow(prediction[1, :, :]) plt.show()

ภาพรถยนต์ต้นฉบับ

ภาพ semantic mask ซ้อนทับบนรถยนต์

Deep Learning สำหรับภาพด้วย PyTorch

มาฝึกกันเถอะ!

Deep Learning สำหรับภาพด้วย PyTorch

Preparing Video For Download...