Semantisk segmentering med U-Net

Djupinlärning för bilder med PyTorch

Michal Oleszak

Machine Learning Engineer

Semantisk segmentering

  • Ingen åtskillnad mellan olika instanser av samma klass
  • Användbart för medicinsk bildanalys eller satellitbildsanalys
  • Populär arkitektur: U-Net
Djupinlärning för bilder med PyTorch

U-Net-arkitektur

Arkitekturdiagram för U-Net

Enkodare:

  • Konvolutionslager och poolinglager
  • Nedsampling: minskar de spatiala dimensionerna och ökar djupet
Djupinlärning för bilder med PyTorch

U-Net-arkitektur

Arkitekturdiagram för U-Net

Avkodare:

  • Symmetrisk mot enkodaren
  • Uppsampling av särdragskartor med transponerade konvolutioner
Djupinlärning för bilder med PyTorch

U-Net-arkitektur

Arkitekturdiagram för U-Net

Hopkopplingar:

  • Länkar från enkodaren till avkodaren
  • Bevarar detaljer som går förlorade vid nedsampling
Djupinlärning för bilder med PyTorch

Transponerad konvolution

Diagram över transponerad konvolution

  • Uppsampling av särdragskartor i avkodaren: ökar höjd och bredd, minskar djupet
  • Processen för transponerad konvolution:
    1. Infoga nollor mellan eller runt den ingående särdragskartan
    2. Utför en vanlig konvolution på den noll-paddade inmatningen
Djupinlärning för bilder med PyTorch

Transponerad konvolution i PyTorch

import torch.nn as nn

upsample = nn.ConvTranspose2d(
    in_channels=in_channels,
    out_channels=out_channels,
    kernel_size=2,
    stride=2,
)
Djupinlärning för bilder med PyTorch

U-Net: lagerdefinitioner

class UNet(nn.Module):
    def __init__(self, in_channels, out_channels):
        super(UNet, self).__init__()


self.enc1 = self.conv_block(in_channels, 64) self.enc2 = self.conv_block(64, 128) self.enc3 = self.conv_block(128, 256) self.enc4 = self.conv_block(256, 512) self.pool = nn.MaxPool2d(kernel_size=2, stride=2)
self.upconv3 = nn.ConvTranspose2d(512, 256, kernel_size=2, stride=2) self.upconv2 = nn.ConvTranspose2d(256, 128, kernel_size=2, stride=2) self.upconv1 = nn.ConvTranspose2d(128, 64, kernel_size=2, stride=2)
self.dec1 = self.conv_block(512, 256) self.dec2 = self.conv_block(256, 128) self.dec3 = self.conv_block(128, 64) self.out = nn.Conv2d(64, out_channels, kernel_size=1)
  • Enkodare:
    • Konvolutionsblock
      def conv_block(self, in_channels, out_channels):
      return nn.Sequential(
        nn.Conv2d(in_channels, out_channels),
        nn.ReLU(inplace=True),
        nn.Conv2d(out_channels, out_channels),
        nn.ReLU(inplace=True)
      )
      
    • Poolinglager
  • Avkodare:
    • Transponerade konvolutioner
    • Konvolutionsblock
Djupinlärning för bilder med PyTorch

U-Net: forwardmetoden

def forward(self, x):

x1 = self.enc1(x) x2 = self.enc2(self.pool(x1)) x3 = self.enc3(self.pool(x2)) x4 = self.enc4(self.pool(x3))
x = self.upconv3(x4)
x = torch.cat([x, x3], dim=1)
x = self.dec1(x)
x = self.upconv2(x) x = torch.cat([x, x2], dim=1) x = self.dec2(x) x = self.upconv1(x) x = torch.cat([x, x1], dim=1) x = self.dec3(x)
return self.out(x)
  • Skicka indata genom enkodarens konvolutionsblock och poolinglager
  • Avkodare och hopkopplingar:
    • Skicka enkodad indata genom transponerad konvolution
    • Sammanfoga med motsvarande enkodararutdata
    • Skicka genom konvolutionsblock
    • Upprepa för alla avkodarsteg
  • Returnera utdata från det sista avkodarsteget
Djupinlärning för bilder med PyTorch

Köra inferens

model = UNet()
model.eval()


image = Image.open("car.jpg") transform = transforms.Compose([transforms.ToTensor()]) image_tensor = transform(image).unsqueeze(0)
with torch.no_grad(): prediction = model(image_tensor).squeeze(0)
plt.imshow(prediction[1, :, :]) plt.show()

Originalbild på en bil

Semantisk mask överlagd på bilbilden

Djupinlärning för bilder med PyTorch

Nu kör vi en övning!

Djupinlärning för bilder med PyTorch

Preparing Video For Download...