Tworzenie baz wektorowych z ChromaDB

Wprowadzenie do osadzeń z OpenAI API

Emmanuel Pire

Senior Software Engineer, DataCamp

Instalacja ChromaDB

  • ChromaDB to prosta, lecz wydajna baza wektorowa
  • Dwa tryby pracy:
    • Lokalny: idealny do tworzenia i prototypowania
    • Klient/Serwer: przeznaczony do produkcji

ChromaDB w trybie lokalnym i w trybie klient/serwer. W trybie klient/serwer klient i serwer działają jako oddzielne instancje.

Wprowadzenie do osadzeń z OpenAI API

Łączenie z bazą danych

import chromadb

client = chromadb.PersistentClient(path="/path/to/save/to")
  • Dane zostaną zapisane na dysku
Wprowadzenie do osadzeń z OpenAI API

Tworzenie kolekcji

  • Kolekcje są analogiczne do tabel
from chromadb.utils.embedding_functions import OpenAIEmbeddingFunction
collection = client.create_collection(
    name="my_collection",

embedding_function=OpenAIEmbeddingFunction( model_name="text-embedding-3-small", api_key="..." )
)
  • Kolekcje automatycznie tworzą embeddingi
Wprowadzenie do osadzeń z OpenAI API

Inspekcja kolekcji

client.list_collections()
[Collection(name=my_collection)]
Wprowadzenie do osadzeń z OpenAI API

Wstawianie embeddingów

Pojedynczy dokument

collection.add(ids=["my-doc"], documents=["This is the source text"])
  • Identyfikatory muszą być podane
  • Embeddingi zostaną utworzone przez kolekcję!

Wiele dokumentów

collection.add(
  ids=["my-doc-1", "my-doc-2"], 
  documents=["This is document 1", "This is document 2"]
)
Wprowadzenie do osadzeń z OpenAI API

Inspekcja kolekcji

Liczenie dokumentów w kolekcji

collection.count()
3
Wprowadzenie do osadzeń z OpenAI API

Inspekcja kolekcji

Podgląd pierwszych 10 elementów

collection.peek()
{'ids': ['my-doc', 'my-doc-1', 'my-doc-2'],
 'embeddings': [[...], [...], [...]],
 'documents': ['This is the source text',
  'This is document 1',
  'This is document 2'],
 'metadatas': [None, None, None]}
Wprowadzenie do osadzeń z OpenAI API

Pobieranie elementów

collection.get(ids=["s59"])
{'ids': ['s59'],
 'embeddings': None,
 'metadatas': [None],
 'documents': ['Title: Naruto Shippûden the Movie: The Will of Fire (Movie)\nDescription: When ...'],
 'uris': None,
 'data': None}
Wprowadzenie do osadzeń z OpenAI API

Zbiór danych Netflix

 

Title: Kota Factory (TV Show)
Description: In a city of coaching centers known to train India's finest...
Categories: International TV Shows, Romantic TV Shows, TV Comedies
Title: The Last Letter From Your Lover (Movie)
Description: After finding a trove of love letters from 1965, a reporter sets...
Categories: Dramas, Romantic Movies
Wprowadzenie do osadzeń z OpenAI API

Szacowanie kosztu embeddingów

  • Model embeddingów (text-embedding-3-small) kosztuje 0,00002 USD / 1k tokenów
cost = 0.00002 * len(tokens)/1000
  • Liczenie tokenów za pomocą biblioteki tiktoken
    • pip install tiktoken
1 https://openai.com/pricing
Wprowadzenie do osadzeń z OpenAI API

Szacowanie kosztu embeddingów

import tiktoken

enc = tiktoken.encoding_for_model("text-embedding-3-small")

total_tokens = sum(len(enc.encode(text)) for text in documents)
cost_per_1k_tokens = 0.00002 print('Total tokens:', total_tokens) print('Cost:', cost_per_1k_tokens * total_tokens/1000)
Total tokens: 444463
Cost: 0.00888926
Wprowadzenie do osadzeń z OpenAI API

Czas na ćwiczenia!

Wprowadzenie do osadzeń z OpenAI API

Preparing Video For Download...