Pythonでの音声データ入門

Pythonで学ぶ音声言語処理

Daniel Bourke

Machine Learning Engineer/YouTube Creator

Pythonで音声ファイルを扱う

  • 代表的な音声ファイル形式

    • mp3
    • wav
    • m4a
    • flac
  • デジタル音は周波数(kHz)で表す

    • 1 kHz = 1秒あたり1000個の情報
Pythonで学ぶ音声言語処理

周波数の例

  • ストリーミング楽曲は32 kHz
  • オーディオブックや音声は8〜16 kHz

  • 音声は見えないため、まず変換が必要

import wave
Pythonで学ぶ音声言語処理

Pythonで音声ファイルを開く

  • 音声ファイル名:good-morning.wav
    # 音声ファイルをwaveオブジェクトとして読み込む
    good_morning = wave.open("good-morning.wav", "r")
    
# waveオブジェクトをバイト列に変換
good_morning_soundwave = good_morning.readframes(-1)
# バイト列を表示
good_morning_soundwave
b'\xfd\xff\xfb\xff\xf8\xff\xf8\xff\xf7\...
Pythonで学ぶ音声言語処理

音声処理は少し特殊

  • 解析に使える形式へ変換が必要
  • 短い音声でも情報量は大きい
Pythonで学ぶ音声言語処理

演習に進みましょう!

Pythonで学ぶ音声言語処理

Preparing Video For Download...