Text-to-speech (TTS)

Multimodala system med OpenAI API

James Chapman

Curriculum Manager, DataCamp

Text-to-speech

 

  • Webbläsare, mobilappar, tillgänglighet
  • Text → realistiskt mänskligt tal
  • Förbättrar tillgänglighet

Text-to-speech i en mobilapp.

Multimodala system med OpenAI API

Text-to-speech med OpenAI

  • Audio-endpoint → .speech.create()
response = client.audio.speech.create(

model="gpt-4o-mini-tts",
voice="onyx",
input="Creating human-like speech is now possible with just a few lines of code. Pretty neat, right?"
)
response.stream_to_file("output.mp3")
  • response_format: "mp3", "opus", "aac", "flac", "wav" och "pcm"
1 https://www.openai.fm/
Multimodala system med OpenAI API

Onyx

Onyx-rösten visualiserad som en virtuell assistent.

Multimodala system med OpenAI API

OpenAI TTS

  • Optimerad för engelska

Onyx-rösten visualiserad som en virtuell assistent.

En ikon med en ljudinspelning och ett textblock.

Multimodala system med OpenAI API

Nu kör vi en övning!

Multimodala system med OpenAI API

Preparing Video For Download...