Zamiana mowy na tekst

Systemy multimodalne z OpenAI API

James Chapman

Curriculum Manager, DataCamp

Co nas czeka...

$$

Cele kursu
  • Modele audio OpenAI
  • Moderacja tekstu
  • Studium przypadku: chatbot obsługi klienta

Obraz przedstawiający modele audio, moderację tekstu i studium przypadku

Systemy multimodalne z OpenAI API

Podsumowanie...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Klucz API nie jest wymagany—jest już skonfigurowany 🎉
Systemy multimodalne z OpenAI API

Podsumowanie...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • OpenAI API wykracza poza tekst 🚀
Systemy multimodalne z OpenAI API

Modele audio OpenAI

Zamiana mowy na tekst — możliwości:

  • Transkrypcja audio
  • Tłumaczenie audio w językach innych niż angielski
  • Obsługuje mp3, mp4, mpeg, mpga, m4a, wav i webm (limit 25 MB)

 

Zastosowania:

  • Transkrypcje spotkań
  • Napisy do filmów

Ikona przedstawiająca nagranie audio i blok tekstu.

  • Przetwarzanie rozmów z klientami
Systemy multimodalne z OpenAI API

Wczytywanie plików audio

 

Przykład: transkrypcja meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Jeśli plik znajduje się w innym katalogu

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Systemy multimodalne z OpenAI API

Tworzenie transkrypcji

  • Endpoint audio
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Systemy multimodalne z OpenAI API

Transkrypcja

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Systemy multimodalne z OpenAI API

Transkrypcja audio w językach innych niż angielski

Ikona przedstawiająca nagranie audio i blok tekstu.

Proces transkrypcji:

  1. open() plik audio
  2. Wysłanie żądania transkrypcji
  3. Wyodrębnienie tekstu
Systemy multimodalne z OpenAI API

Tworzenie tłumaczeń

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Systemy multimodalne z OpenAI API

Wydajność transkrypcji

 

  • Wydajność może się znacznie różnić w zależności od:
    • Jakości dźwięku
    • Języka nagrania
    • Wiedzy modelu na dany temat

Różne języki na świecie.

Systemy multimodalne z OpenAI API

Czas na ćwiczenia!

Systemy multimodalne z OpenAI API

Preparing Video For Download...