Tal till text

Multimodala system med OpenAI API

James Chapman

Curriculum Manager, DataCamp

Kommande avsnitt...

$$

Kursmål
  • OpenAI:s ljudmodeller
  • Textmoderering
  • Fallstudie: Kundsupportchattbot

En bild som visar ljudmodeller, textmoderering och en fallstudie

Multimodala system med OpenAI API

Repetition...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Ingen API-nyckel krävs—den är redan konfigurerad 🎉
Multimodala system med OpenAI API

Repetition...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • OpenAI API går bortom text 🚀
Multimodala system med OpenAI API

OpenAI:s ljudmodeller

Tal till text – funktioner:

  • Transkribera ljud
  • Översätt ljud på andra språk
  • Stöder mp3, mp4, mpeg, mpga, m4a, wav och webm (gräns 25 MB)

 

Användningsområden:

  • Mötesutskrifter
  • Videotextning

En ikon som visar en ljudinspelning och ett textblock.

  • Bearbetning av kundsamtal
Multimodala system med OpenAI API

Läsa in ljudfiler

 

Exempel: transkribera meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Om filen finns i en annan katalog

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Multimodala system med OpenAI API

Skapa transkriptionen

  • Ljudslutpunkt
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Multimodala system med OpenAI API

Transkriptet

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Multimodala system med OpenAI API

Transkribera ljud på andra språk

En ikon som visar en ljudinspelning och ett textblock.

Transkribera – arbetsflöde:

  1. open() ljudfilen
  2. Skicka en transkriberingsförfrågan
  3. Extrahera texten
Multimodala system med OpenAI API

Skapa översättningar

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Multimodala system med OpenAI API

Transkriberingsprestanda

 

  • Prestandan kan variera kraftigt beroende på:
    • Ljudkvalitet
    • Ljudspråk
    • Modellens ämneskunskap

Olika språk runt om i världen.

Multimodala system med OpenAI API

Nu kör vi en övning!

Multimodala system med OpenAI API

Preparing Video For Download...