Conversie vorbire-text

Sisteme multi-modale cu API-ul OpenAI

James Chapman

Curriculum Manager, DataCamp

Urmează...

$$

Obiectivele cursului
  • Modelele audio OpenAI
  • Moderarea textului
  • Studiu de caz: chatbot pentru asistență clienți

O imagine cu modele audio, moderare text și un studiu de caz

Sisteme multi-modale cu API-ul OpenAI

Recapitulare...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Nu este necesară o cheie API—este deja configurată 🎉
Sisteme multi-modale cu API-ul OpenAI

Recapitulare...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • API-ul OpenAI depășește granițele textului 🚀
Sisteme multi-modale cu API-ul OpenAI

Modelele audio OpenAI

Capacități conversie vorbire-text:

  • Transcriere audio
  • Traducere audio non-engleză
  • Suportă mp3, mp4, mpeg, mpga, m4a, wav și webm (limită 25 MB)

 

Cazuri de utilizare:

  • Transcrieri de întâlniri
  • Subtitrări video

O iconiță reprezentând o înregistrare audio și un bloc de text.

  • Procesarea apelurilor clienților
Sisteme multi-modale cu API-ul OpenAI

Încărcarea fișierelor audio

 

Exemplu: transcriere meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Dacă fișierul se află într-un director diferit

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Sisteme multi-modale cu API-ul OpenAI

Crearea transcrierii

  • Endpoint audio
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Sisteme multi-modale cu API-ul OpenAI

Transcrierea

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Sisteme multi-modale cu API-ul OpenAI

Transcrierea fișierelor audio non-engleze

O iconiță reprezentând o înregistrare audio și un bloc de text.

Flux de transcriere:

  1. open() fișier audio
  2. Trimiteți o cerere de transcriere
  3. Extrageți textul
Sisteme multi-modale cu API-ul OpenAI

Crearea traducerilor

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Sisteme multi-modale cu API-ul OpenAI

Performanța transcrierii

 

  • Performanța poate varia semnificativ, în funcție de:
    • Calitatea audio
    • Limba audio
    • Cunoștințele modelului despre subiect

Diferite limbi din lume.

Sisteme multi-modale cu API-ul OpenAI

Să exersăm!

Sisteme multi-modale cu API-ul OpenAI

Preparing Video For Download...