推荐系统

使用 OpenAI API 的 Embeddings 入门

Emmanuel Pire

Senior Software Engineer, DataCamp

基于嵌入的推荐系统

 

  • 与语义搜索非常相似!

 

流程:

  1. 对候选项和数据点做嵌入

向量空间中一个蓝点和若干红点。

使用 OpenAI API 的 Embeddings 入门

基于嵌入的推荐系统

 

  • 与语义搜索非常相似!

 

流程:

  1. 对候选项和数据点做嵌入
  2. 计算余弦距离

向量空间中一个蓝点和若干红点。每个红点和蓝点之间画有一条线表示余弦距离。

使用 OpenAI API 的 Embeddings 入门

基于嵌入的推荐系统

 

  • 与语义搜索非常相似!

 

流程:

  1. 对候选项和数据点做嵌入
  2. 计算余弦距离
  3. 推荐最近的项

已高亮三个最近的红点。

使用 OpenAI API 的 Embeddings 入门

示例:推荐文章

articles = [
    {"headline": "Economic Growth Continues Amid Global Uncertainty",
     "topic": "Business",
     "keywords": ["economy", "business", "finance"]},
    ...
    {"headline": "1.5 Billion Tune-in to the World Cup Final",
     "topic": "Sport",
     "keywords": ["soccer", "world cup", "tv"]}
]

current_article = {"headline": "How NVIDIA GPUs Could Decide Who Wins the AI Race", "topic": "Tech", "keywords": ["ai", "business", "computers"]}
使用 OpenAI API 的 Embeddings 入门

特征合并

def create_article_text(article):
  return f"""Headline: {article['headline']}
Topic: {article['topic']}
Keywords: {', '.join(article['keywords'])}"""
article_texts = [create_article_text(article) for article in articles]
current_article_text = create_article_text(current_article)
print(current_article_text)
Headline: How NVIDIA GPUs Could Decide Who Wins the AI Race
Topic: Tech
Keywords: ai, business, computers
使用 OpenAI API 的 Embeddings 入门

创建嵌入

def create_embeddings(texts):
  response = openai.Embedding.create(
    model="text-embedding-3-small",
    input=texts
  )
  response_dict = response.model_dump()

  return [data['embedding'] for data in response_dict['data']]
current_article_embeddings = create_embeddings(current_article_text)[0]
article_embeddings = create_embeddings(article_texts)
使用 OpenAI API 的 Embeddings 入门

查找最相似的文章

def find_n_closest(query_vector, embeddings, n=3):
  distances = []
  for index, embedding in enumerate(embeddings):
    dist = spatial.distance.cosine(query_vector, embedding)
    distances.append({"distance": dist, "index": index})
  distances_sorted = sorted(distances, key=lambda x: x["distance"])
  return distances_sorted[0:n]
hits = find_n_closest(current_article_embeddings, article_embeddings)

for hit in hits: article = articles[hit['index']] print(article['headline'])
使用 OpenAI API 的 Embeddings 入门

查找最相似的文章

Tech Giant Buys 49% Stake In AI Startup
Tech Company Launches Innovative Product to Improve Online Accessibility
Scientists Make Breakthrough Discovery in Renewable Energy
使用 OpenAI API 的 Embeddings 入门

加入用户历史

user_history = [
    {"headline": "How NVIDIA GPUs Could Decide Who Wins the AI Race",
     "topic": "Tech",
     "keywords": ["ai", "business", "computers"]},
    {"headline": "Tech Giant Buys 49% Stake In AI Startup",
     "topic": "Tech",
     "keywords": ["business", "AI"]}
]
使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

嵌入文章的散点图;用户历史中的文章为蓝色,未读文章为红色。

使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

 

流程:

  • 取多个向量的均值合并为一个
  • 计算余弦距离

在两个点之间新增一个取均值得到的点。

使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

 

流程:

  • 取多个向量的均值合并为一个
  • 计算余弦距离
  • 推荐最近的向量

已高亮最近的红点以供推荐。

使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

 

流程:

  • 取多个向量的均值合并为一个
  • 计算余弦距离
  • 推荐最近的向量

最近点已被标为蓝色,表示需排除用户已读文章。

使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

 

流程:

  • 取多个向量的均值合并为一个
  • 计算余弦距离
  • 推荐最近的向量
    • 确保为未读

这次高亮的是更远的最近红点。

使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

def create_article_text(article):
  return f"""Headline: {article['headline']}
Topic: {article['topic']}
Keywords: {', '.join(article['keywords'])}"""

history_texts = [create_article_text(article) for article in user_history]
history_embeddings = create_embeddings(history_texts)

mean_history_embeddings = np.mean(history_embeddings, axis=0)
articles_filtered = [article for article in articles if article not in user_history]
article_texts = [create_article_text(article) for article in articles_filtered] article_embeddings = create_embeddings(article_texts)
使用 OpenAI API 的 Embeddings 入门

基于多个数据点的推荐

hits = find_n_closest(mean_history_embeddings, article_embeddings)

for hit in hits: article = articles_filtered[hit['index']] print(article['headline'])
Tech Company Launches Innovative Product to Improve Online Accessibility
New Social Media Platform Has Everyone Talking!
Scientists Make Breakthrough Discovery in Renewable Energy
使用 OpenAI API 的 Embeddings 入门

Passons à la pratique !

使用 OpenAI API 的 Embeddings 入门

Preparing Video For Download...