Python 音訊資料入門

Python 的口語語言處理

Daniel Bourke

Machine Learning Engineer/YouTube Creator

在 Python 處理音訊檔

  • 常見音訊檔案種類

    • mp3
    • wav
    • m4a
    • flac
  • 數位聲音以頻率(kHz)衡量

    • 1 kHz = 每秒 1000 筆資訊
Python 的口語語言處理

頻率範例

  • 串流音樂常見頻率為 32 kHz
  • 有聲書與口語多在 8–16 kHz 之間

  • 音訊檔看不見,需先轉換後才能分析

import wave
Python 的口語語言處理

在 Python 開啟音訊檔

  • 音訊檔名為 good-morning.wav
    # 匯入音訊檔為 wave 物件
    good_morning = wave.open("good-morning.wav", "r")
    
# 將 wave 物件轉為位元組
good_morning_soundwave = good_morning.readframes(-1)
# 以位元組形式檢視 wav 檔
good_morning_soundwave
b'\xfd\xff\xfb\xff\xf8\xff\xf8\xff\xf7\...
Python 的口語語言處理

處理音訊很不一樣

  • 需要將音訊轉成可用的表示方式
  • 小段音訊也會包含大量資訊
Python 的口語語言處理

一起來練習吧!

Python 的口語語言處理

Preparing Video For Download...