语义搜索与增强型嵌入

使用 OpenAI API 的 Embeddings 入门

Emmanuel Pire

Senior Software Engineer, DataCamp

语义搜索

  • 使用嵌入返回与查询最相似的结果
  • 示例:新闻网站的语义搜索

语义搜索如何工作:嵌入模型对搜索文本进行嵌入,然后计算其与已嵌入标题之间的距离。返回最近的标题。

使用 OpenAI API 的 Embeddings 入门

语义搜索

语义搜索如何工作:嵌入模型对搜索文本进行嵌入,然后计算其与已嵌入标题之间的距离。返回最近的标题。

  1. 将查询与其他文本进行嵌入
  2. 计算余弦距离
  3. 取出余弦距离_最小_的文本
使用 OpenAI API 的 Embeddings 入门

增强型嵌入

articles = [
    {"headline": "Economic Growth Continues Amid Global Uncertainty",
     "topic": "Business",
     "keywords": ["economy", "business", "finance"]},
    ...
    {"headline": "1.5 Billion Tune-in to the World Cup Final",
     "topic": "Sport",
     "keywords": ["soccer", "world cup", "tv"]}
]
Headline: Economic Growth Continues Amid Global Uncertainty
Topic: Business
Keywords: economy, business, finance
使用 OpenAI API 的 Embeddings 入门

用 F-strings 组合要素

articles = [..., {"headline": "1.5 Billion Tune-in to the World Cup ",
                  "topic": "Sport",
                  "keywords": ["soccer", "world cup", "tv"]}]


def create_article_text(article):
return f"""Headline: {article['headline']} Topic: {article['topic']} Keywords: {', '.join(article['keywords'])}"""
print(create_article_text(articles[-1]))
Headline: 1.5 Billion Tune-in to the World Cup Final
Topic: Sport
Keywords: soccer, world cup, tv
使用 OpenAI API 的 Embeddings 入门

创建增强型嵌入

article_texts = [create_article_text(article) for article in articles]

article_embeddings = create_embeddings(article_texts)
print(article_embeddings)
[[-0.019609929993748665, -0.03331860154867172, ...],
 ...,
 [..., -0.014373429119586945, -0.005235843360424042]]
使用 OpenAI API 的 Embeddings 入门

计算距离

from scipy.spatial import distance

def find_n_closest(query_vector, embeddings, n=3):

distances = [] for index, embedding in enumerate(embeddings): dist = distance.cosine(query_vector, embedding) distances.append({"distance": dist, "index": index})
distances_sorted = sorted(distances, key=lambda x: x["distance"])
return distances_sorted[0:n]
使用 OpenAI API 的 Embeddings 入门

返回搜索结果

query_text = "AI"

query_vector = create_embeddings(query_text)[0]
hits = find_n_closest(query_vector, article_embeddings)
for hit in hits: article = articles[hit['index']] print(article['headline'])
Tech Giant Buys 49% Stake In AI Startup
Tech Company Launches Innovative Product to Improve Online Accessibility
India Successfully Lands Near Moon's South Pole
使用 OpenAI API 的 Embeddings 入门

Passons à la pratique !

使用 OpenAI API 的 Embeddings 入门

Preparing Video For Download...