テキストの類似度

OpenAI API ではじめる Embeddings 入門

Emmanuel Pire

Senior Software Engineer, DataCamp

復習

 

  • 意味的に類似したテキストはベクトル空間内でより近くに配置される
  • 距離を測定することで類似度を計測できる
  • 埋め込みの応用例:
    • セマンティック検索
    • レコメンデーション
    • 分類

 

同じ感情やトピックを持つレビューがベクトル空間内でより近くにマッピングされることを示す2次元ベクトル空間のプロット。

OpenAI API ではじめる Embeddings 入門

類似度の測定

 

コサイン距離

from scipy.spatial import distance

distance.cosine([0, 1], [1, 0])
1.0
  • 範囲は0から2
  • 値が小さいほど類似度が高い

 

2つのベクトル間に直線が引かれた図。

OpenAI API ではじめる Embeddings 入門

例:見出しの類似度比較

見出しとその埋め込みを含む辞書のリスト。

OpenAI API ではじめる Embeddings 入門

例:見出しの類似度比較

def create_embeddings(texts):
  response = client.embeddings.create(
    model="text-embedding-3-small",
    input=texts
  )
  response_dict = response.model_dump()

  return [data['embedding'] for data in response_dict['data']]
print(create_embeddings(["Python is the best!", "R is the best!"]))

print(create_embeddings("DataCamp is awesome!")[0])
[[0.0050565884448587894, ..., , -0.04000323638319969],
 [-0.0018890155479311943, ..., -0.04085670784115791]]

[0.00037010075175203383, ..., -0.021759100258350372]
OpenAI API ではじめる Embeddings 入門

例:見出しの類似度比較

from scipy.spatial import distance
import numpy as np

search_text = "computer"
search_embedding = create_embeddings(search_text)[0]
distances = []
for article in articles:
dist = distance.cosine(search_embedding, article["embedding"])
distances.append(dist)
min_dist_ind = np.argmin(distances)
print(articles[min_dist_ind]['headline'])
Tech Company Launches Innovative Product to Improve Online Accessibility
OpenAI API ではじめる Embeddings 入門

練習しましょう!

OpenAI API ではじめる Embeddings 入門

Preparing Video For Download...