Преобразование речи в текст

Мультимодальные системы с OpenAI API

James Chapman

Curriculum Manager, DataCamp

Что впереди...

$$

Цели курса
  • Аудиомодели OpenAI
  • Модерация текста
  • Практический пример: чат-бот службы поддержки

Изображение, показывающее аудиомодели, модерацию текста и практический пример

Мультимодальные системы с OpenAI API

Повторение...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • API-ключ не нужен—он уже настроен для вас 🎉
Мультимодальные системы с OpenAI API

Повторение...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • Возможности OpenAI API не ограничиваются текстом 🚀
Мультимодальные системы с OpenAI API

Аудиомодели OpenAI

Возможности преобразования речи в текст:

  • Транскрипция аудио
  • Перевод аудио на других языках
  • Поддержка форматов mp3, mp4, mpeg, mpga, m4a, wav и webm (лимит 25 МБ)

 

Сценарии использования:

  • Транскрипция совещаний
  • Субтитры к видео

Значок, изображающий запись аудио и текстовый блок.

  • Обработка звонков клиентов
Мультимодальные системы с OpenAI API

Загрузка аудиофайлов

 

Пример: транскрипция meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Если файл находится в другой директории

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Мультимодальные системы с OpenAI API

Создание транскрипции

  • Эндпоинт для работы с аудио
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Мультимодальные системы с OpenAI API

Транскрипт

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Мультимодальные системы с OpenAI API

Транскрипция аудио на других языках

Значок, изображающий запись аудио и текстовый блок.

Процесс транскрипции:

  1. Откройте аудиофайл с помощью open()
  2. Отправьте запрос на транскрипцию
  3. Извлеките текст
Мультимодальные системы с OpenAI API

Создание переводов

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Мультимодальные системы с OpenAI API

Точность транскрипции

 

  • Качество результата может существенно варьироваться в зависимости от:
    • Качества аудио
    • Языка аудио
    • Знакомства модели с предметной областью

Языки мира.

Мультимодальные системы с OpenAI API

Давайте потренируемся!

Мультимодальные системы с OpenAI API

Preparing Video For Download...