Introduktion till ljuddata i Python

Taligenkänning i Python

Daniel Bourke

Machine Learning Engineer/YouTube Creator

Hantera ljudfiler i Python

  • Olika typer av ljudfiler

    • mp3
    • wav
    • m4a
    • flac
  • Digitalt ljud mäts i frekvens (kHz)

    • 1 kHz = 1 000 datapunkter per sekund
Taligenkänning i Python

Exempel på frekvenser

  • Musikstreaming har en frekvens på 32 kHz
  • Ljudböcker och talat språk ligger mellan 8 och 16 kHz

  • Ljudfiler kan inte visas direkt – de måste omvandlas först

import wave
Taligenkänning i Python

Öppna en ljudfil i Python

  • Ljudfilen är sparad som good-morning.wav
    # Import audio file as wave object
    good_morning = wave.open("good-morning.wav", "r")
    
# Convert wave object to bytes
good_morning_soundwave = good_morning.readframes(-1)
# View the wav file in byte form
good_morning_soundwave
b'\xfd\xff\xfb\xff\xf8\xff\xf8\xff\xf7\...
Taligenkänning i Python

Ljud är annorlunda att arbeta med

  • Ljudet måste omvandlas till ett användbart format
  • Ett litet ljudklipp innehåller stora mängder information
Taligenkänning i Python

Nu kör vi en övning!

Taligenkänning i Python

Preparing Video For Download...