Načítání dokumentů pro RAG s LangChain

Retrieval Augmented Generation (RAG) with LangChain

Meri Nova

Machine Learning Engineer

Seznamte se s lektorem...

 

Meri Nova

 

  • Zakladatelka Break Into Data
  • Inženýrka strojového učení
  • Tvůrkyně obsahu na LinkedIn a YouTube

Fotografie Meri.

Retrieval Augmented Generation (RAG) with LangChain

Retrieval Augmented Generation (RAG)

 

  • Omezení LLM: omezené znalosti

 

RAG: integrace externích dat s LLM

Člověk předávající LLM další informace v podobě knih.

1 Generated with DALL·E 3
Retrieval Augmented Generation (RAG) with LangChain

Standardní pracovní postup RAG

Jeden uživatel.

Retrieval Augmented Generation (RAG) with LangChain

Standardní pracovní postup RAG

Dotaz uživatele odeslaný do vektorové databáze.

Retrieval Augmented Generation (RAG) with LangChain

Standardní pracovní postup RAG

Relevantní dokumenty načtené z vektorové databáze.

Retrieval Augmented Generation (RAG) with LangChain

Standardní pracovní postup RAG

Načtené dokumenty přidané do promptu modelu.

Retrieval Augmented Generation (RAG) with LangChain

Standardní pracovní postup RAG

Prompt odeslaný do LLM a výstup vrácený uživateli.

Retrieval Augmented Generation (RAG) with LangChain

Příprava dat pro vyhledávání

Načítání dokumentů.

Retrieval Augmented Generation (RAG) with LangChain

Příprava dat pro vyhledávání

Rozdělování dokumentů.

Retrieval Augmented Generation (RAG) with LangChain

Příprava dat pro vyhledávání

Části dokumentů jsou vektorizovány.

Retrieval Augmented Generation (RAG) with LangChain

Příprava dat pro vyhledávání

Části dokumentů jsou uloženy.

Retrieval Augmented Generation (RAG) with LangChain

Nástroje pro načítání dokumentů

 

  • Integrace dokumentů s AI systémy
  • Podpora mnoha běžných formátů souborů
  • Nástroje třetích stran pro načítání dokumentů

 

  • CSVLoader
  • PyPDFLoader
  • UnstructuredHTMLLoader

Načítání dokumentů.

Retrieval Augmented Generation (RAG) with LangChain

Načítání souborů CSV

from langchain_community.document_loaders.csv_loader import CSVLoader

csv_loader = CSVLoader(file_path='path/to/your/file.csv')

documents = csv_loader.load() print(documents)
[Document(page_content='Team: Nationals\n"Payroll (millions)": 81.34\n"Wins": 98',
          metadata={'source': 'path/to/your/file.csv', 'row': 0}),
 Document(page_content='Team: Reds\n"Payroll (millions)": 82.20\n"Wins": 97',
          metadata={'source': 'path/to/your/file.csv', 'row': 1}),
 Document(page_content='Team: Yankees\n"Payroll (millions)": 197.96\n"Wins": 95',
          metadata={'source': 'path/to/your/file.csv', 'row': 2})]
Retrieval Augmented Generation (RAG) with LangChain

Načítání souborů PDF

from langchain_community.document_loaders import PyPDFLoader

pdf_loader = PyPDFLoader('rag_paper.pdf')
documents = pdf_loader.load()
print(documents)
[Document(page_content='Retrieval-Augmented Generation for\nKnowledge-Intensive...',
          metadata={'source': 'Rag Paper.pdf', 'page': 0})]
Retrieval Augmented Generation (RAG) with LangChain

Načítání souborů HTML

from langchain_community.document_loaders import UnstructuredHTMLLoader

html_loader = UnstructuredHTMLLoader(file_path='path/to/your/file.html')

documents = html_loader.load() first_document = documents[0]
print("Content:", first_document.page_content) print("Metadata:", first_document.metadata)
Content: Welcome to Our Website
Metadata: {'source': 'path/to/your/file.html', 'section': 0}
Retrieval Augmented Generation (RAG) with LangChain

Pojďme procvičovat!

Retrieval Augmented Generation (RAG) with LangChain

Preparing Video For Download...