Розпізнавання мовлення

Мультимодальні системи з OpenAI API

James Chapman

Curriculum Manager, DataCamp

Далі буде…

$$

Цілі курсу
  • Аудіомоделі OpenAI
  • Модерація тексту
  • Кейс: чатбот підтримки клієнтів

Зображення з аудіомоделями, модерацією тексту та кейсом

Мультимодальні системи з OpenAI API

Підсумуємо…

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Ключ API не потрібен — усе вже налаштовано для вас 🎉
Мультимодальні системи з OpenAI API

Підсумуємо…

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • OpenAI API — це не лише текст 🚀
Мультимодальні системи з OpenAI API

Аудіомоделі OpenAI

Можливості speech-to-text:

  • Транскрибувати аудіо
  • Перекладати неангломовне аудіо
  • Підтримка mp3, mp4, mpeg, mpga, m4a, wav і webm (ліміт 25 MB)

 

Приклади використання:

  • Протоколи зустрічей
  • Субтитри до відео

Піктограма із записом аудіо та текстовим блоком.

  • Обробка дзвінків клієнтів
Мультимодальні системи з OpenAI API

Завантаження аудіофайлів

 

Приклад: транскрибувати meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Якщо файл у іншому каталозі

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Мультимодальні системи з OpenAI API

Створення транскрипції

  • Точка доступу Audio
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Мультимодальні системи з OpenAI API

Транскрипт

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Мультимодальні системи з OpenAI API

Транскрипція неангломовного аудіо

Піктограма із записом аудіо та текстовим блоком.

Робочий процес транскрипції:

  1. open() аудіофайл
  2. Надіслати запит на транскрипцію
  3. Витягти текст
Мультимодальні системи з OpenAI API

Створення перекладів

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Мультимодальні системи з OpenAI API

Продуктивність транскрипції

 

  • Якість може суттєво відрізнятися, залежно від:
    • якості аудіо
    • мови аудіо
    • обізнаності моделі з темою

Різні мови світу.

Мультимодальні системи з OpenAI API

Давайте потренуємось!

Мультимодальні системи з OpenAI API

Preparing Video For Download...