音声合成(TTS)

OpenAI APIで学ぶマルチモーダルシステム

James Chapman

Curriculum Manager, DataCamp

音声合成(TTS)

 

  • ブラウザ、モバイルアプリ、アクセシビリティ
  • テキスト → 自然な音声
  • アクセシビリティ向上

モバイルアプリでの音声合成の例。

OpenAI APIで学ぶマルチモーダルシステム

OpenAIでの音声合成

  • Audio エンドポイント → .speech.create()
response = client.audio.speech.create(

model="gpt-4o-mini-tts",
voice="onyx",
input="Creating human-like speech is now possible with just a few lines of code. Pretty neat, right?"
)
response.stream_to_file("output.mp3")
  • response_format: "mp3", "opus", "aac", "flac", "wav", "pcm"
1 https://www.openai.fm/
OpenAI APIで学ぶマルチモーダルシステム

Onyx

仮想アシスタントとして表現された Onyx の声。

OpenAI APIで学ぶマルチモーダルシステム

OpenAI TTS

  • 英語向けに最適化

仮想アシスタントとして表現された Onyx の声。

音声録音とテキストのアイコン。

OpenAI APIで学ぶマルチモーダルシステム

練習してみましょう!

OpenAI APIで学ぶマルチモーダルシステム

Preparing Video For Download...