SpeechRecognitionで音声ファイルを読み込む

Pythonで学ぶ音声言語処理

Daniel Bourke

Machine Learning Engineer/YouTube Creator

AudioFile クラス

import speech_recognition as sr

# 認識器を用意 recognizer = sr.Recognizer()
# 音声ファイルを読み込む clean_support_call = sr.AudioFile("clean-support-call.wav")
# clean_support_call の型を確認 type(clean_support_call)
<class 'speech_recognition.AudioFile'>
Pythonで学ぶ音声言語処理

AudioFile から AudioData へ

recognizer.recognize_google(audio_data=clean_support_call)
AssertionError: ``audio_data`` must be audio data
# AudioFile を AudioData に変換
with clean_support_call as source:

# 音声を取得 clean_support_call_audio = recognizer.record(source)
# 型を確認 type(clean_support_call_audio)
<class 'speech_recognition.AudioData'>
Pythonで学ぶ音声言語処理

AudioData を文字起こし

# クリーンなサポート通話を文字起こし
recognizer.recognize_google(audio_data=clean_support_call_audio)
hello I'd like to get some help setting up my account please
Pythonで学ぶ音声言語処理

duration と offset

  • durationoffset は既定でどちらも None
# duration/offset は既定値のまま
with clean_support_call as source:
    clean_support_call_audio = recognizer.record(source,
                                                 duration=None,
                                                 offset=None)
# 先頭2秒のみを取得
with clean_support_call as source:
    clean_support_call_audio = recognizer.record(source,
                                                 duration=2.0)
hello I'd like to get
Pythonで学ぶ音声言語処理

演習に進みましょう!

Pythonで学ぶ音声言語処理

Preparing Video For Download...