Xử lý các loại âm thanh khác nhau

Xử lý Ngôn ngữ Nói bằng Python

Daniel Bourke

Machine Learning Engineer/YouTube Creator

Ngôn ngữ nào?

# Tạo đối tượng nhận dạng
recognizer = sr.Recognizer()

# Truyền âm thanh tiếng Nhật vào recognize_google text = recognizer.recognize_google(japanese_good_morning, language="en-US")
# In văn bản print(text)
Ohio gozaimasu
Xử lý Ngôn ngữ Nói bằng Python

Ngôn ngữ nào?

# Tạo đối tượng nhận dạng
recognizer = sr.Recognizer()

# Truyền âm thanh tiếng Nhật vào recognize_google text = recognizer.recognize_google(japanese_good_morning, language="ja")
# In văn bản print(text)
おはようございます
Xử lý Ngôn ngữ Nói bằng Python

Âm thanh phi lời nói

# Import tệp tiếng gầm báo đốm
leopard_roar = sr.AudioFile("leopard_roar.wav")

# Chuyển AudioFile thành AudioData with leopard_roar as source: leopard_roar_audio = recognizer.record(source)
# Nhận dạng AudioData recognizer.recognize_google(leopard_roar_audio)
UnknownValueError:
Xử lý Ngôn ngữ Nói bằng Python

Âm thanh phi lời nói

# Import tệp tiếng gầm báo đốm
leopard_roar = sr.AudioFile("leopard_roar.wav")

# Chuyển AudioFile thành AudioData with leopard_roar as source: leopard_roar_audio = recognizer.record(source)
# Nhận dạng AudioData với show_all bật recognizer.recognize_google(leopard_roar_audio, show_all=True)
[]
Xử lý Ngôn ngữ Nói bằng Python

Hiển thị tất cả

# Nhận dạng tiếng Nhật với show_all=True
text = recognizer.recognize_google(japanese_good_morning, 
                                   language="en-US",
                                   show_all=True)
# In văn bản
print(text)
{'alternative': [{'transcript': 'Ohio gozaimasu', 'confidence': 0.89041114},
  {'transcript': 'all hail gozaimasu'},
  {'transcript': 'ohayo gozaimasu'},
  {'transcript': 'olho gozaimasu'},
  {'transcript': 'all Hale gozaimasu'}],
 'final': True}
Xử lý Ngôn ngữ Nói bằng Python

Nhiều người nói

# Import một tệp âm thanh có nhiều người nói
multiple_speakers = sr.AudioFile("multiple-speakers.wav")

# Chuyển AudioFile thành AudioData with multiple_speakers as source: multiple_speakers_audio = recognizer.record(source)
# Nhận dạng AudioData recognizer.recognize_google(multiple_speakers_audio)
một hạn chế của thư viện nhận dạng giọng nói là không
phân biệt được người nói/giọng khác nhau và sẽ trả về tất cả như một khối 
văn bản
Xử lý Ngôn ngữ Nói bằng Python

Nhiều người nói

# Nhập các tệp âm thanh riêng lẻ
speakers = [sr.AudioFile("s0.wav"), sr.AudioFile("s1.wav"), sr.AudioFile("s2.wav")]

# Phiên âm từng người nói for i, speaker in enumerate(speakers): with speaker as source: speaker_audio = recognizer.record(source) print(f"Text from speaker {i}: {recognizer.recognize_google(speaker_audio)}")
Text from speaker 0: one of the limitations of the speech recognition library
Text from speaker 1: is that it doesn't recognise different speakers and voices
Text from speaker 2: it will just return it all as one block a text
Xử lý Ngôn ngữ Nói bằng Python

Âm thanh nhiễu

  • Nếu bạn nghe không rõ, API cũng vậy
# Import tệp âm thanh có tiếng ồn nền
noisy_support_call = sr.AudioFile(noisy_support_call.wav)

with noisy_support_call as source: # Điều chỉnh tiếng ồn môi trường và ghi âm recognizer.adjust_for_ambient_noise(source, duration=0.5) noisy_support_call_audio = recognizer.record(source)
# Nhận dạng âm thanh recognizer.recognize_google(noisy_support_call_audio)
hello ID like to get some help setting up my calories
Xử lý Ngôn ngữ Nói bằng Python

Ayo berlatih!

Xử lý Ngôn ngữ Nói bằng Python

Preparing Video For Download...