Synthèse vocale (TTS)

Systèmes multimodaux avec l'API d'OpenAI

James Chapman

Curriculum Manager, DataCamp

Synthèse vocale

 

  • Navigateurs, applis mobiles, accessibilité
  • Texte → voix humaine réaliste
  • Améliore l'accessibilité

Synthèse vocale dans une appli mobile.

Systèmes multimodaux avec l'API d'OpenAI

Synthèse vocale avec OpenAI

  • Point de terminaison Audio.speech.create()
response = client.audio.speech.create(

model="gpt-4o-mini-tts",
voice="onyx",
input="Creating human-like speech is now possible with just a few lines of code. Pretty neat, right?"
)
response.stream_to_file("output.mp3")
  • response_format : "mp3", "opus", "aac", "flac", "wav", et "pcm"
1 https://www.openai.fm/
Systèmes multimodaux avec l'API d'OpenAI

Onyx

La voix Onyx représentée comme une assistance virtuelle.

Systèmes multimodaux avec l'API d'OpenAI

OpenAI TTS

  • Optimisée pour l'anglais

La voix Onyx représentée comme une assistance virtuelle.

Icône montrant un enregistrement audio et un bloc de texte.

Systèmes multimodaux avec l'API d'OpenAI

Passons à la pratique !

Systèmes multimodaux avec l'API d'OpenAI

Preparing Video For Download...