Badanie przestrzeni wektorowej

Wprowadzenie do osadzeń z OpenAI API

Emmanuel Pire

Senior Software Engineer, DataCamp

Przykład: osadzanie nagłówków

articles = [
    {"headline": "Economic Growth Continues Amid Global Uncertainty", "topic": "Business"},
    {"headline": "Interest rates fall to historic lows", "topic": "Business"},
    {"headline": "Scientists Make Breakthrough Discovery in Renewable Energy", "topic": "Science"},
    {"headline": "India Successfully Lands Near Moon's South Pole", "topic": "Science"},
    {"headline": "New Particle Discovered at CERN", "topic": "Science"},
    {"headline": "Tech Company Launches Innovative Product to Improve Online Accessibility", "topic": "Tech"},
    {"headline": "Tech Giant Buys 49% Stake In AI Startup", "topic": "Tech"},
    {"headline": "New Social Media Platform Has Everyone Talking!", "topic": "Tech"},
    {"headline": "The Blues get promoted on the final day of the season!", "topic": "Sport"},
    {"headline": "1.5 Billion Tune-in to the World Cup Final", "topic": "Sport"}
]
Wprowadzenie do osadzeń z OpenAI API

Przykład: osadzanie nagłówków

Lista słowników zawierających nagłówki i ich osadzenia.

Wprowadzenie do osadzeń z OpenAI API

Osadzanie wielu danych wejściowych

headline_text = [article['headline'] for article in articles]
headline_text
["Economic Growth Continues Amid Global Uncertainty",
 ...,
 "1.5 Billion Tune-in to the World Cup Final"]
response = client.embeddings.create(
  model="text-embedding-3-small",
  input=headline_text
)
response_dict = response.model_dump()
  • Przetwarzanie wsadowe jest wydajniejsze niż wielokrotne wywołania API
Wprowadzenie do osadzeń z OpenAI API
[...]

'data': [
    {
      "embedding": [-0.017142612487077713, ..., -0.0012911480152979493],
      "index": 0,
      "object": "embedding"
    },
    {
      "embedding": [-0.032995883375406265, ..., -0.0028605300467461348],
      "index": 1,
      "object": "embedding"
    },
    ...
  ]

[...]
Wprowadzenie do osadzeń z OpenAI API

Osadzanie wielu danych wejściowych

articles = [
    {"headline": "Economic Growth Continues Amid Global Uncertainty", "topic": "Business"},
     ...
]
for i, article in enumerate(articles):

article['embedding'] = response_dict['data'][i]['embedding']
print(articles[:2])
[{'headline': 'Economic Growth Continues Amid Global Uncertainty',
  'topic': 'Business',
  'embedding': [-0.017142612487077713, ..., -0.0012911480152979493]}
 {'headline': 'Interest rates fall to historic lows',
  'topic': 'Business',
  'embedding': [-0.032995883375406265, ..., -0.0028605300467461348]}]
Wprowadzenie do osadzeń z OpenAI API

Jak długi jest wektor osadzeń?

  • "Economic Growth Continues Amid Global Uncertainty"
len(articles[0]['embedding'])
1536
  • "Tech Company Launches Innovative Product to Improve Accessibility"
len(articles[5]['embedding'])
1536
  • Zawsze zwraca 1536 liczb!
Wprowadzenie do osadzeń z OpenAI API

Redukcja wymiarowości i t-SNE

 

  • Różne techniki redukcji liczby wymiarów
  • t-SNE (t-rozkładowe stochastyczne osadzanie sąsiadów)
1 https://www.datacamp.com/tutorial/introduction-t-sne
Wprowadzenie do osadzeń z OpenAI API

Implementacja t-SNE

from sklearn.manifold import TSNE
import numpy as np


embeddings = [article['embedding'] for article in articles]
tsne = TSNE(n_components=2, perplexity=5)
embeddings_2d = tsne.fit_transform(np.array(embeddings))
  • n_components: wynikowa liczba wymiarów
  • perplexity: parametr algorytmu, musi być mniejszy niż liczba punktów danych
  • Powoduje utratę informacji
1 https://www.datacamp.com/tutorial/introduction-t-sne
Wprowadzenie do osadzeń z OpenAI API

Wizualizacja osadzeń

import matplotlib.pyplot as plt

plt.scatter(embeddings_2d[:, 0], embeddings_2d[:, 1])

topics = [article['topic'] for article in articles] for i, topic in enumerate(topics): plt.annotate(topic, (embeddings_2d[i, 0], embeddings_2d[i, 1])) plt.show()
Wprowadzenie do osadzeń z OpenAI API

Wizualizacja osadzeń

 

  • Podobne artykuły są grupowane razem!
  • Model uchwycił semantyczne znaczenie

 

  • Następnie: obliczanie podobieństwa

 

Wykres 2D przestrzeni wektorowej pokazujący, że artykuły z tym samym tematem są odwzorowane bliżej siebie.

Wprowadzenie do osadzeń z OpenAI API

Czas na ćwiczenia!

Wprowadzenie do osadzeń z OpenAI API

Preparing Video For Download...