Převod řeči na text

Multimodální systémy s OpenAI API

James Chapman

Curriculum Manager, DataCamp

Co nás čeká...

$$

Cíle kurzu
  • Zvukové modely OpenAI
  • Moderování textu
  • Případová studie: chatbot zákaznické podpory

Obrázek zobrazující zvukové modely, moderování textu a případovou studii

Multimodální systémy s OpenAI API

Rekapitulace...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Klíč API není potřeba—je již nastaven 🎉
Multimodální systémy s OpenAI API

Rekapitulace...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • OpenAI API jde za hranice textu 🚀
Multimodální systémy s OpenAI API

Zvukové modely OpenAI

Možnosti převodu řeči na text:

  • Přepis zvuku
  • Překlad neanglického zvuku
  • Podporuje mp3, mp4, mpeg, mpga, m4a, wav a webm (limit 25 MB)

 

Případy použití:

  • Přepisy schůzek
  • Titulky videí

Ikona zobrazující zvukovou nahrávku a blok textu.

  • Zpracování hovorů se zákazníky
Multimodální systémy s OpenAI API

Načítání zvukových souborů

 

Příklad: přepis meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Pokud se soubor nachází v jiném adresáři

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Multimodální systémy s OpenAI API

Vytvoření přepisu

  • Audio endpoint
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Multimodální systémy s OpenAI API

Přepis

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Multimodální systémy s OpenAI API

Přepis neanglického zvuku

Ikona zobrazující zvukovou nahrávku a blok textu.

Postup přepisu:

  1. open() zvukový soubor
  2. Odeslat žádost o přepis
  3. Extrahovat text
Multimodální systémy s OpenAI API

Vytváření překladů

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Multimodální systémy s OpenAI API

Výkon přepisu

 

  • Výkon se může výrazně lišit v závislosti na:
    • Kvalitě zvuku
    • Jazyce zvuku
    • Znalosti tématu modelem

Různé jazyky světa.

Multimodální systémy s OpenAI API

Lass uns üben!

Multimodální systémy s OpenAI API

Preparing Video For Download...