エンコーダ・デコーダ型 Transformer

PyTorchで学ぶTransformerモデル

James Chapman

Curriculum Manager, DataCamp

エンコーダとデコーダの連携

元の Transformer アーキテクチャ

PyTorchで学ぶTransformerモデル

エンコーダとデコーダの連携

エンコーダとデコーダの統合

PyTorchで学ぶTransformerモデル

クロスアテンション機構

 

  1. デコーダ全体で処理された情報
  2. エンコーダブロックの最終隠れ状態

 

クロスアテンションの例

クロスアテンション付きデコーダ

PyTorchで学ぶTransformerモデル

DecoderLayer の変更

 

  1. デコーダ全体で処理された情報
  2. エンコーダブロックの最終隠れ状態

 

  • x: デコーダの情報フロー。クロスアテンションのQueryになる
  • y: エンコーダ出力。クロスアテンションのKeyValueになる
class DecoderLayer(nn.Module):
    def __init__(self, d_model, num_heads, d_ff, dropout):
        super().__init__()
        self.self_attn = MultiHeadAttention(
                          d_model, num_heads)
        self.cross_attn = MultiHeadAttention(
                          d_model, num_heads)
        ...


def forward(self, x, y, tgt_mask, cross_mask): self_attn_output = self.self_attn(x, x, x, tgt_mask) x = self.norm1(x + self.dropout(self_attn_output)) cross_attn_output = self.cross_attn(x, y, y, cross_mask) x = self.norm2(x + self.dropout(cross_attn_output)) ...
PyTorchで学ぶTransformerモデル

DecoderTransformer の変更

 

デコーダ専用
class TransformerDecoder(nn.Module):
...
def forward(self, x, tgt_mask):
    x = self.embedding(x)
    x = self.positional_encoding(x)
    for layer in self.layers:
        x = layer(x, tgt_mask)
    x = self.fc(x)
    return F.log_softmax(x, dim=-1)

 

エンコーダ・デコーダ
class TransformerDecoder(nn.Module):
...

def forward(self, x, y, tgt_mask, cross_mask): x = self.embedding(x) x = self.positional_encoding(x) for layer in self.layers: x = layer(x, y, tgt_mask, cross_mask) x = self.fc(x) return F.log_softmax(x, dim=-1)
PyTorchで学ぶTransformerモデル

エンコーダとデコーダの連携

エンコーダとデコーダの統合

PyTorchで学ぶTransformerモデル

Transformer ヘッド

 

翻訳の出力例

  • jugar(遊ぶ): 0.03
  • viajar(旅行する): 0.96
  • dormir(寝る): 0.01

他のタスクでは、別の活性化関数が必要な場合があります

Transformer ヘッド付きデコーダ

PyTorchで学ぶTransformerモデル

すべてを統合

エンコーダ・デコーダ型 Transformer 全体像

PyTorchで学ぶTransformerモデル

すべてを統合

class InputEmbeddings(nn.Module):
  ...  
class PositionalEncoding(nn.Module):
  ...  
class MultiHeadAttention(nn.Module):
  ...
class FeedForwardSubLayer(nn.Module):
  ...  
class EncoderLayer(nn.Module):
  ...
class DecoderLayer(nn.Module):
  ...
class TransformerEncoder(nn.Module):
  ...
class TransformerDecoder(nn.Module):
  ...
class ClassificationHead(nn.Module):
  ...
class Transformer(nn.Module):
    def __init__(self, vocab_size, d_model, num_heads, 
                 num_layers, d_ff, max_seq_len, dropout):
        super().__init__()


self.encoder = TransformerEncoder(vocab_size, d_model, num_heads, num_layers, d_ff, dropout, max_seq_len) self.decoder = TransformerDecoder(vocab_size, d_model, num_heads, num_layers, d_ff, dropout, max_seq_len)
def forward(self, x, src_mask, tgt_mask, cross_mask): encoder_output = self.encoder(x, src_mask) decoder_output = self.decoder(x, encoder_output, tgt_mask, cross_mask) return decoder_output
PyTorchで学ぶTransformerモデル

Ayo berlatih!

PyTorchで学ぶTransformerモデル

Preparing Video For Download...