Requêtes multiples et filtrage

Introduction aux embeddings avec l'API d'OpenAI

Emmanuel Pire

Senior Software Engineer, DataCamp

Recommandations de films basées sur plusieurs points de données

 

  • Terrifier (id : 's8170')
  • Strawberry Shortcake: Berry Bitty Adventures (id : 's8103')
Introduction aux embeddings avec l'API d'OpenAI

Textes de requête multiples

reference_ids = ['s8170', 's8103']


reference_texts = collection.get(ids=reference_ids)["documents"]
result = collection.query( query_texts=reference_texts, n_results=3 )
Introduction aux embeddings avec l'API d'OpenAI

Résultat pour plusieurs textes de requête

{'ids': [['s8170', 's6939', 's7000'],['s8103', 's2968', 's3085']],
 'embeddings': None,
 'documents': [['Title: Terrifier (Movie)...',
   'Title: Haunters: The Art of the Scare (Movie)...',
   'Title: Horror Story (Movie)...'],
  ["Title: Strawberry Shortcake: Berry Bitty Adventures (TV Show)...",
   "Title: Shopkins (TV Show)...",
   "Title: Rainbow Ruby (TV Show)..."]],
 'metadatas': [[None, None, None], [None, None, None]],
 'distances': [[0.00, 0.25, 0.26], [0.00, 0.25, 0.28]]}
Introduction aux embeddings avec l'API d'OpenAI

Ajout de métadonnées

import csv 

ids = []
metadatas = []

with open('netflix_titles.csv') as csvfile:
  reader = csv.DictReader(csvfile)
  for i, row in enumerate(reader):
    ids.append(row['show_id'])
    metadatas.append({
      "type":row['type'],
      "release_year": int(row['release_year'])
    })

 

  • Créer une liste de dict pour les métadonnées
  • Créer une liste d'ID pour les associer aux éléments existants
Introduction aux embeddings avec l'API d'OpenAI

Ajout et interrogation des métadonnées

 

collection.update(ids=ids, metadatas=metadatas)
result = collection.query(
    query_texts=reference_texts, 
    n_results=3,
    where={ 
        "type": "Movie"
    }
)
Introduction aux embeddings avec l'API d'OpenAI

Opérateurs de "where"

where={
  "type": "Movie"
}

est équivalent à

where={
  "type": {
    "$eq": "Movie"
  }
}

Liste des opérateurs :

  • $eq – égal à (chaîne, int, float)
  • $ne – différent de (chaîne, int, float)
  • $gt – supérieur à (int, float)
  • $gte – supérieur ou égal à (int, float)
  • $lt – inférieur à (int, float)
  • $lte – inférieur ou égal à (int, float)
Introduction aux embeddings avec l'API d'OpenAI

Plusieurs filtres "where"

where={
    "$and": [
        {"type": 
            {"$eq": "Movie"}
        },
        {"release_year": 
             {"$gt": 2020}
        }
    ]
}

 

  • $or : filtrer selon au moins une condition
Introduction aux embeddings avec l'API d'OpenAI
Title: A Classic Horror Story (Movie) [...]
===
Title: Nightbooks (Movie) [...]
===
Title: Irul (Movie) [...]
===
Title: Intrusion (Movie) [...]
===
Title: Things Heard & Seen (Movie) [...]
===
Title: A StoryBots Space Adventure (Movie) [...]
Introduction aux embeddings avec l'API d'OpenAI

Passons à la pratique !

Introduction aux embeddings avec l'API d'OpenAI

Preparing Video For Download...