Tinh chỉnh nâng cao

Các khái niệm về Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

Ta đang ở đâu?

hình tiến độ cho thấy ta đang ở giai đoạn Tinh chỉnh nâng cao

Các khái niệm về Large Language Models (LLMs)

Học tăng cường qua phản hồi của con người

 

  • Tiền huấn luyện

 

  • Tinh chỉnh

 

  • Reinforcement Learning through Human Feedback (RLHF)

 

Minh họa bốn người đưa phản hồi tích cực bằng emoji và sao.

Các khái niệm về Large Language Models (LLMs)

Tiền huấn luyện

  • Khối lượng lớn văn bản:
    • Website, sách và bài viết
    • Kiến trúc Transformer
    • Học mẫu ngôn ngữ chung, ngữ pháp và sự kiện

 

  • Dự đoán từ tiếp theo
  • Mô hình hóa ngôn ngữ che mặt nạ

Quy trình tiền huấn luyện để xây dựng LLM

1 Freepik
Các khái niệm về Large Language Models (LLMs)

Tinh chỉnh

 

  • Huấn luyện N-shot

 

  • Bộ dữ liệu gán nhãn nhỏ cho tác vụ liên quan

Quy trình tinh chỉnh

Các khái niệm về Large Language Models (LLMs)

Vậy, tại sao RLHF?

  • Dữ liệu huấn luyện mục đích chung kém chất lượng
    • Nhiễu
    • Lỗi
    • Không nhất quán
    • Giảm độ chính xác

Ví dụ về giảm độ chính xác:

  • Huấn luyện trên dữ liệu từ diễn đàn trực tuyến
  • Ý kiến và sự kiện chưa được kiểm chứng
  • Cần chuyên gia bên ngoài xác thực

 

Bia bắn cung với mũi tên không trúng hồng tâm

Các khái niệm về Large Language Models (LLMs)

Bắt đầu từ nhu cầu tinh chỉnh

  • Tiền huấn luyện
    • Học mẫu ngôn ngữ nền tảng
    • Không nắm bắt hết ngữ cảnh đặc thù

 

  • Tinh chỉnh
    • Dữ liệu gán nhãn chất lượng cải thiện hiệu suất

 

  • Đến RLHF!
    • Phản hồi từ con người
Các khái niệm về Large Language Models (LLMs)

Đơn giản hóa RLHF

 

  • Đầu ra mô hình được con người rà soát
  • Cập nhật mô hình theo phản hồi

 

  • Bước 1:
    • Nhận prompt
    • Tạo nhiều đáp án

 

 

Một LLM nhận prompt đầu vào và tạo phản hồi

Các khái niệm về Large Language Models (LLMs)

Có chuyên gia tham gia

 

  • Bước 2:
    • Chuyên gia kiểm tra các đáp án
    • Xếp hạng theo chất lượng
      • Độ chính xác
      • Mức liên quan
      • Tính mạch lạc

thêm xác minh của con người vào phản hồi LLM

Các khái niệm về Large Language Models (LLMs)

Đến lúc phản hồi

  • Bước 3:
    • Học từ xếp hạng của chuyên gia
    • Căn chỉnh phản hồi sau này theo ưu tiên của họ

 

  • Quy trình lặp lại!
    • Tiếp tục tạo đáp án
    • Nhận xếp hạng của chuyên gia
    • Điều chỉnh học tập

 

 

Phản hồi của con người được đưa lại cho LLM

Các khái niệm về Large Language Models (LLMs)

Tóm tắt

  • Tiền huấn luyện để học kiến thức ngôn ngữ chung

 

  • Tinh chỉnh cho tác vụ cụ thể

 

  • RLHF để nâng cao tinh chỉnh bằng phản hồi con người

 

  • Kết hợp cực kỳ hiệu quả!
Các khái niệm về Large Language Models (LLMs)

Hoàn thiện LLM

Quy trình huấn luyện LLM hoàn chỉnh

Các khái niệm về Large Language Models (LLMs)

Ayo berlatih!

Các khái niệm về Large Language Models (LLMs)

Preparing Video For Download...