使用教师强制训练模型

使用 Keras 的机器翻译

Thushan Ganegedara

Data Scientist and Author

模型训练要点

  • 训练模型需要:
    • 损失函数(如 categorical crossentropy)
    • 优化器(如 Adam)
使用 Keras 的机器翻译

模型训练要点

  • 计算损失需要:

    • 基于输入生成的概率预测([batch_size, seq_len, vocab_size]
      • 例如 [[0.11,...,0.81,0.04], [0.05,...,0.01, 0.93], ..., [0.78,..., 0.03,0.01]]
    • 实际法语目标的 onehot 编码([batch_size, seq_len, vocab_size]
      • 例如 [[0, ..., 1, 0], [0, ..., 0, 1],..., [0, ..., 1, 0]]
    • 交叉熵:目标与预测词分布的差异
  • 将损失传给优化器,以更新参数并最小化损失

使用 Keras 的机器翻译

使用教师强制训练模型

n_epochs, bsize = 3, 250
for ei in range(n_epochs):
  for i in range(0,data_size,bsize):

# 编码器输入、解码器输入与输出 en_x = sents2seqs('source', en_text[i:i+bsize], onehot=True, reverse=True) de_xy = sents2seqs('target', fr_text[i:i+bsize], onehot=True)
# 划分解码器输入与输出 de_x = de_xy[:,:-1,:] de_y = de_xy[:,1:,:]
# 单个批次的训练与评估 nmt_tf.train_on_batch([en_x,de_x], de_y) res = nmt_tf.evaluate([en_x,de_x], de_y, batch_size=bsize, verbose=0) print("{} => 训练损失:{}, 训练准确率: {}".format(ei+1,res[0], res[1]*100.0))
使用 Keras 的机器翻译

数组切片详解

    de_x = de_xy[:,:-1,:]    
    de_y = de_xy[:,1:,:]

数组切片

使用 Keras 的机器翻译

构建训练与验证集

train_size, valid_size = 800, 200
# 创建数据索引
inds = np.arange(len(en_text))
np.random.shuffle(inds)

# 划分训练与验证索引 train_inds = inds[:train_size] valid_inds = inds[train_size:train_size+valid_size]
# 提取训练与验证数据 tr_en = [en_text[ti] for ti in train_inds] tr_fr = [fr_text[ti] for ti in train_inds] v_en = [en_text[vi] for vi in valid_inds] v_fr = [fr_text[vi] for vi in valid_inds]
print('Training (EN):\n', tr_en[:2], '\nTraining (FR):\n', tr_fr[:2]) print('\nValid (EN):\n', tr_en[:2], '\nValid (FR):\n', tr_fr[:2])
验证 (EN): ['she saw that rusty blue truck .', 'france is usually snowy during autumn , ...'] 
验证 (FR): ['elle a vu ce camion bleu rouillé .', 'la france est généralement enneigée en automne ...']
使用 Keras 的机器翻译

带验证的训练

for ei in range(n_epochs):
  for i in range(0,train_size,bsize):    
    en_x = sents2seqs('source', tr_en[i:i+bsize], onehot=True, reverse=True)
    de_xy = sents2seqs('target', tr_fr[i:i+bsize], onehot=True)
    de_x, de_y = de_xy[:,:-1,:], de_xy[:,1:,:]
    nmt_tf.train_on_batch([en_x, de_x], de_y)

v_en_x = sents2seqs('source', v_en, onehot=True, reverse=True) v_de_xy = sents2seqs('target', v_fr, onehot=True) v_de_x, v_de_y = v_de_xy[:,:-1,:], v_de_xy[:,1:,:]
res = nmt_tf.evaluate([v_en_x, v_de_x], v_de_y, batch_size=valid_size, verbose=0) print("Epoch {} => Loss:{}, Val Acc: {}".format(ei+1,res[0], res[1]*100.0))
第 1 轮 => 损失:4.784221172332764, 验证准确率: 1.4999999664723873
第 2 轮 => 损失:4.716882228851318, 验证准确率: 44.458332657814026
第 3 轮 => 损失:4.63267183303833, 验证准确率: 47.333332896232605
使用 Keras 的机器翻译

开始训练!

使用 Keras 的机器翻译

Preparing Video For Download...