Reconnaissance vocale (speech-to-text)

Systèmes multimodaux avec l'API d'OpenAI

James Chapman

Curriculum Manager, DataCamp

À venir…

$$

Objectifs du cours
  • Modèles audio d'OpenAI
  • Modération de texte
  • Étude de cas : clavardeur de soutien à la clientèle

Une image montrant des modèles audio, la modération de texte et une étude de cas

Systèmes multimodaux avec l'API d'OpenAI

Récap…

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Aucune clé API requise : tout est déjà configuré pour vous 🎉
Systèmes multimodaux avec l'API d'OpenAI

Récap…

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • L'API OpenAI va au-delà du texte 🚀
Systèmes multimodaux avec l'API d'OpenAI

Modèles audio d'OpenAI

Fonctionnalités de speech-to-text :

  • Transcrire l'audio
  • Traduire de l'audio non anglais
  • Prend en charge mp3, mp4, mpeg, mpga, m4a, wav et webm (limite 25 Mo)

 

Cas d'usage :

  • Comptes rendus de réunions
  • Sous-titres vidéo

Icône montrant un enregistrement audio et un bloc de texte.

  • Traitement des appels clients
Systèmes multimodaux avec l'API d'OpenAI

Chargement des fichiers audio

 

Exemple : transcrire meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Si le fichier se trouve dans un autre répertoire

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Systèmes multimodaux avec l'API d'OpenAI

Créer la transcription

  • Point de terminaison audio
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Systèmes multimodaux avec l'API d'OpenAI

La transcription

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Systèmes multimodaux avec l'API d'OpenAI

Transcrire de l'audio non anglais

Icône montrant un enregistrement audio et un bloc de texte.

Flux de transcription :

  1. open() le fichier audio
  2. Envoyer une demande de transcription
  3. Extraire le texte
Systèmes multimodaux avec l'API d'OpenAI

Créer des traductions

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Systèmes multimodaux avec l'API d'OpenAI

Rendement de transcription

 

  • Le rendement peut varier grandement selon :
    • La qualité audio
    • La langue de l'audio
    • Les connaissances du modèle sur le sujet

Différentes langues dans le monde.

Systèmes multimodaux avec l'API d'OpenAI

Passons à la pratique !

Systèmes multimodaux avec l'API d'OpenAI

Preparing Video For Download...