Text-to-speech (TTS)

Sistemas multimodales con la API de OpenAI

James Chapman

Curriculum Manager, DataCamp

Text-to-speech

 

  • Internet browsers, mobile apps, accessibility
  • Text → realistic human speech
  • Improve accessibility

Text-to-speech on a mobile app.

Sistemas multimodales con la API de OpenAI

Text-to-speech with OpenAI

  • Audio endpoint → .speech.create()
response = client.audio.speech.create(

model="gpt-4o-mini-tts",
voice="onyx",
input="Creating human-like speech is now possible with just a few lines of code. Pretty neat, right?"
)
response.stream_to_file("output.mp3")
  • response_format: "mp3", "opus", "aac", "flac", "wav", and "pcm"
1 https://www.openai.fm/
Sistemas multimodales con la API de OpenAI

Onyx

The Onyx voice depicted as a virtual assistant.

Sistemas multimodales con la API de OpenAI

OpenAI TTS

  • Optimized for English

The Onyx voice depicted as a virtual assistant.

An icon showing an audio recording and a text block.

Sistemas multimodales con la API de OpenAI

Let's practice!

Sistemas multimodales con la API de OpenAI

Preparing Video For Download...