Ujaran ke teks

Sistem Multi-Modal dengan OpenAI API

James Chapman

Curriculum Manager, DataCamp

Berikutnya...

$$

Tujuan kursus
  • Model audio OpenAI
  • Moderasi teks
  • Studi kasus: chatbot dukungan pelanggan

Gambar yang menampilkan model audio, moderasi teks, dan studi kasus

Sistem Multi-Modal dengan OpenAI API

Rekap...

from openai import OpenAI


# Create the OpenAI client client = OpenAI(api_key="<OPENAI_API_TOKEN>")
# Create a request to the Chat Completions endpoint response = client.chat.completions.create(
model="gpt-4o-mini", messages=[{"role": "user", "content": "What is the OpenAI API?"}]
)
  • Tidak perlu kunci API—sudah disiapkan untuk Anda 🎉
Sistem Multi-Modal dengan OpenAI API

Rekap...

# Extract the content from the response
print(response.choices[0].message.content)
The OpenAI API is a cloud-based service provided by OpenAI that allows developers
to integrate advanced AI models into their applications.

$$

  • OpenAI API tidak hanya untuk teks 🚀
Sistem Multi-Modal dengan OpenAI API

Model audio OpenAI

Kemampuan ujaran ke teks:

  • Transkripsikan audio
  • Terjemahkan audio non‑Inggris
  • Mendukung mp3, mp4, mpeg, mpga, m4a, wav, dan webm (batas 25 MB)

 

Kasus penggunaan:

  • Transkrip rapat
  • Takarir video

Ikon yang menampilkan rekaman audio dan blok teks.

  • Memproses panggilan pelanggan
Sistem Multi-Modal dengan OpenAI API

Memuat file audio

 

Contoh: transkripsikan meeting_recording.mp3

audio_file = open("meeting_recording.mp3", "rb")

$$

Jika file ada di direktori lain

audio_file = open("path/to/file/meeting_recording.mp3", "rb")
Sistem Multi-Modal dengan OpenAI API

Membuat transkripsi

  • Endpoint audio
audio_file= open("meeting_recording.mp3", "rb")

response = client.audio.transcriptions.create(
model="whisper-1",
file=audio_file
)
print(response)
Transcription(text="Welcome everyone to the June product monthly. We'll get started in...)
1 https://platform.openai.com/docs/guides/speech-to-text
Sistem Multi-Modal dengan OpenAI API

Teks transkrip

print(response.text)
Welcome everyone to the June product monthly. We'll get started in just a minute.
Alright, let's get started. Today's agenda will start with a spotlight from Chris
on the new mobile user onboarding flow, then we'll review how we're tracking on
our quarterly targets, and finally, we'll finish with another spotlight from Katie
who will discuss the upcoming branding updates...
Sistem Multi-Modal dengan OpenAI API

Transkripsi audio non‑Inggris

Ikon yang menampilkan rekaman audio dan blok teks.

Alur transkripsi:

  1. open() file audio
  2. Kirim permintaan transkripsi
  3. Ekstrak teks
Sistem Multi-Modal dengan OpenAI API

Membuat terjemahan

audio_file = open("non_english_audio.m4a", "rb")


response = client.audio.translations.create(
model="whisper-1",
file=audio_file
)
print(response.text)
The search volume for keywords like A I has increased rapidly since the launch of
Cha GTP.
Sistem Multi-Modal dengan OpenAI API

Kinerja transkripsi

 

  • Kinerja bisa sangat bervariasi, tergantung pada:
    • Kualitas audio
    • Bahasa audio
    • Pengetahuan model tentang topik

Berbagai bahasa di seluruh dunia.

Sistem Multi-Modal dengan OpenAI API

Ayo berlatih!

Sistem Multi-Modal dengan OpenAI API

Preparing Video For Download...