マルチ入力モデル

PyTorchによる中級ディープラーニング

Michal Oleszak

Machine Learning Engineer

マルチ入力が必要な理由

より多くの情報を活用する

2枚の車の画像を入力として受け取り、1つの出力を生成するモデルの概略図。

マルチモーダルモデル

画像とテキストを入力として受け取り、テキストを出力するモデルの概略図。

距離学習

2枚の顔画像を入力として受け取り、同一人物かどうかを予測するモデルの概略図。

自己教師あり学習

同じ画像の2つの拡張バージョンを入力として受け取り、それらが同一であることを学習するモデルの概略図。

PyTorchによる中級ディープラーニング

Omniglotデータセット

Omniglotデータセットの画像サンプル。

1 Lake, B. M., Salakhutdinov, R., and Tenenbaum, J. B. (2015). Human-level concept learning through probabilistic program induction. Science, 350(6266), 1332-1338.
PyTorchによる中級ディープラーニング

文字分類

モデル概略図:文字画像がニューラルネットワークに入力される。

PyTorchによる中級ディープラーニング

文字分類

モデル概略図:ワンホットアルファベットベクトルがニューラルネットワークに入力される。

PyTorchによる中級ディープラーニング

文字分類

モデル概略図:文字埋め込みとアルファベット埋め込みが結合される。

PyTorchによる中級ディープラーニング

文字分類

モデル概略図:結合された埋め込みから分類器が文字を予測する。

PyTorchによる中級ディープラーニング

2入力データセット

from PIL import Image

class OmniglotDataset(Dataset):

def __init__(self, transform, samples): self.transform = transform self.samples = samples
def __len__(self): return len(self.samples)
def __getitem__(self, idx): img_path, alphabet, label = self.samples[idx] img = Image.open(img_path).convert('L') img = self.transform(img) return img, alphabet, label
  • サンプルと変換を割り当てる

    print(samples[0])
    
    [(
      'omniglot_train/.../0459_14.png',
       array([1., 0., 0., ..., 0., 0., 0.]),
       0
     )]
    
  • __len__()を実装する

  • 画像の読み込みと変換

  • 両入力とラベルを返す
PyTorchによる中級ディープラーニング

テンソルの結合

x = torch.tensor([
  [1, 2, 3],
])

y = torch.tensor([
  [4, 5, 6],
])

軸0に沿った結合

torch.cat((x, y), dim=0)
[[1, 2, 3],
 [4, 5, 6]]

軸1に沿った結合

torch.cat((x, y), dim=1)
[[1, 2, 3, 4, 5, 6]]
PyTorchによる中級ディープラーニング

2入力アーキテクチャ

class Net(nn.Module):
    def __init__(self):
        super().__init__()

self.image_layer = nn.Sequential( nn.Conv2d(1, 16, kernel_size=3, padding=1), nn.MaxPool2d(kernel_size=2), nn.ELU(), nn.Flatten(), nn.Linear(16*32*32, 128) )
self.alphabet_layer = nn.Sequential( nn.Linear(30, 8), nn.ELU(), )
self.classifier = nn.Sequential( nn.Linear(128 + 8, 964), )
  • 画像処理層を定義する
  • アルファベット処理層を定義する
  • 分類器層を定義する
PyTorchによる中級ディープラーニング

2入力アーキテクチャ

def forward(self, x_image, x_alphabet):

x_image = self.image_layer(x_image)
x_alphabet = self.alphabet_layer(x_alphabet)
x = torch.cat((x_image, x_alphabet), dim=1)
return self.classifier(x)
  • 画像を画像層に通す
  • アルファベットをアルファベット層に通す
  • 画像とアルファベットの出力を結合する
  • 結果を分類器に通す
PyTorchによる中級ディープラーニング

訓練ループ

net = Net()
criterion = nn.CrossEntropyLoss()
optimizer = optim.SGD(net.parameters(), lr=0.01)

for epoch in range(10):
    for img, alpha, labels in dataloader_train:
        optimizer.zero_grad()
        outputs = net(img, alpha)
        loss = criterion(outputs, labels)
        loss.backward()
        optimizer.step()
  • 訓練データは3つの要素で構成される:
    • 画像
    • アルファベットベクトル
    • ラベル
  • モデルに画像とアルファベットを渡す
PyTorchによる中級ディープラーニング

さあ、練習しましょう!

PyTorchによる中級ディープラーニング

Preparing Video For Download...