การโหลดเอกสารสำหรับ RAG ด้วย LangChain

Retrieval Augmented Generation (RAG) ด้วย LangChain

Meri Nova

Machine Learning Engineer

แนะนำผู้สอน...

 

Meri Nova

 

  • ผู้ก่อตั้ง Break Into Data
  • Machine Learning Engineer
  • Content Creator บน LinkedIn และ YouTube

ภาพถ่ายของ Meri

Retrieval Augmented Generation (RAG) ด้วย LangChain

Retrieval Augmented Generation (RAG)

 

  • ข้อจำกัดของ LLM: ความรู้ที่มีจำกัด

 

RAG: นำข้อมูลภายนอกมาผสานกับ LLM

บุคคลกำลังส่งข้อมูลเพิ่มเติมในรูปแบบหนังสือให้กับ LLM

1 Generated with DALL·E 3
Retrieval Augmented Generation (RAG) ด้วย LangChain

ขั้นตอน RAG มาตรฐาน

ผู้ใช้คนเดียว

Retrieval Augmented Generation (RAG) ด้วย LangChain

ขั้นตอน RAG มาตรฐาน

คำถามของผู้ใช้ถูกส่งไปยังฐานข้อมูลเวกเตอร์

Retrieval Augmented Generation (RAG) ด้วย LangChain

ขั้นตอน RAG มาตรฐาน

เอกสารที่เกี่ยวข้องถูกดึงมาจากฐานข้อมูลเวกเตอร์

Retrieval Augmented Generation (RAG) ด้วย LangChain

ขั้นตอน RAG มาตรฐาน

เอกสารที่ดึงมาถูกเพิ่มลงใน prompt ของโมเดล

Retrieval Augmented Generation (RAG) ด้วย LangChain

ขั้นตอน RAG มาตรฐาน

prompt ถูกส่งไปยัง LLM และผลลัพธ์ถูกส่งกลับให้ผู้ใช้

Retrieval Augmented Generation (RAG) ด้วย LangChain

การเตรียมข้อมูลสำหรับการดึงข้อมูล

เอกสารกำลังถูกโหลด

Retrieval Augmented Generation (RAG) ด้วย LangChain

การเตรียมข้อมูลสำหรับการดึงข้อมูล

เอกสารกำลังถูกแบ่ง

Retrieval Augmented Generation (RAG) ด้วย LangChain

การเตรียมข้อมูลสำหรับการดึงข้อมูล

ชิ้นส่วนเอกสารถูกแปลงเป็น embedding

Retrieval Augmented Generation (RAG) ด้วย LangChain

การเตรียมข้อมูลสำหรับการดึงข้อมูล

ชิ้นส่วนเอกสารถูกจัดเก็บ

Retrieval Augmented Generation (RAG) ด้วย LangChain

Document loaders

 

  • นำเอกสารมาผสานกับระบบ AI
  • รองรับรูปแบบไฟล์ทั่วไปหลายชนิด
  • Document loader จากบุคคลที่สาม

 

  • CSVLoader
  • PyPDFLoader
  • UnstructuredHTMLLoader

เอกสารกำลังถูกโหลด

Retrieval Augmented Generation (RAG) ด้วย LangChain

การโหลดไฟล์ CSV

from langchain_community.document_loaders.csv_loader import CSVLoader

csv_loader = CSVLoader(file_path='path/to/your/file.csv')

documents = csv_loader.load() print(documents)
[Document(page_content='Team: Nationals\n"Payroll (millions)": 81.34\n"Wins": 98',
          metadata={'source': 'path/to/your/file.csv', 'row': 0}),
 Document(page_content='Team: Reds\n"Payroll (millions)": 82.20\n"Wins": 97',
          metadata={'source': 'path/to/your/file.csv', 'row': 1}),
 Document(page_content='Team: Yankees\n"Payroll (millions)": 197.96\n"Wins": 95',
          metadata={'source': 'path/to/your/file.csv', 'row': 2})]
Retrieval Augmented Generation (RAG) ด้วย LangChain

การโหลดไฟล์ PDF

from langchain_community.document_loaders import PyPDFLoader

pdf_loader = PyPDFLoader('rag_paper.pdf')
documents = pdf_loader.load()
print(documents)
[Document(page_content='Retrieval-Augmented Generation for\nKnowledge-Intensive...',
          metadata={'source': 'Rag Paper.pdf', 'page': 0})]
Retrieval Augmented Generation (RAG) ด้วย LangChain

การโหลดไฟล์ HTML

from langchain_community.document_loaders import UnstructuredHTMLLoader

html_loader = UnstructuredHTMLLoader(file_path='path/to/your/file.html')

documents = html_loader.load() first_document = documents[0]
print("Content:", first_document.page_content) print("Metadata:", first_document.metadata)
Content: Welcome to Our Website
Metadata: {'source': 'path/to/your/file.html', 'section': 0}
Retrieval Augmented Generation (RAG) ด้วย LangChain

มาฝึกกันเถอะ!

Retrieval Augmented Generation (RAG) ด้วย LangChain

Preparing Video For Download...