Các mối quan ngại và cân nhắc về dữ liệu

Các khái niệm về Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

Các cân nhắc về dữ liệu

 

Các cân nhắc về dữ liệu

 

  • Khối lượng dữ liệu và năng lực tính toán
  • Chất lượng dữ liệu
  • Gán nhãn
  • Thiên lệch
  • Quyền riêng tư
Các khái niệm về Large Language Models (LLMs)

Khối lượng dữ liệu và năng lực tính toán

  • LLM cần rất nhiều dữ liệu
    • Tương tự trẻ học nói
    • 570 GB, ~1,3 triệu cuốn sách

 

Trẻ học nói

1 Freepik
Các khái niệm về Large Language Models (LLMs)

Khối lượng dữ liệu và năng lực tính toán

  • LLM cần rất nhiều dữ liệu
    • Tương tự trẻ học nói
    • 570 GB, ~1,3 triệu cuốn sách

 

  • Nhu cầu tính toán lớn; cân nhắc tiêu thụ năng lượng

 

  • Có thể tốn hàng triệu đô!

Người làm việc trên máy tính kết nối máy chủ lớn

Các khái niệm về Large Language Models (LLMs)

Chất lượng dữ liệu

  • Dữ liệu chất lượng là thiết yếu

 

  • Dữ liệu chính xác = học tốt hơn = phản hồi chuẩn hơn = tăng niềm tin

 

  • Trẻ học nói
    • Đầu vào nhảm -> đầu ra nhảm

đầu ra kém nếu huấn luyện LLM với dữ liệu đầy lỗi hoặc ngữ pháp kém

Các khái niệm về Large Language Models (LLMs)

Dữ liệu gán nhãn

  • Nhãn đúng: học chính xác, khái quát mẫu, phản hồi chuẩn

  • Tốn công: gán nhãn đúng cho từng bài viết

Nhóm làm việc trên máy tính để gán nhãn dữ liệu

  • Nhãn sai làm giảm hiệu năng mô hình
  • Xử lý lỗi: xác định -> phân tích -> lặp lại
Các khái niệm về Large Language Models (LLMs)

Thiên lệch dữ liệu

  • Bị ảnh hưởng bởi định kiến xã hội
  • Thiếu đa dạng trong dữ liệu huấn luyện
  • Phân biệt đối xử và kết quả không công bằng

 

  • Phát hiện và xử lý dữ liệu thiên lệch
    • Đánh giá mất cân bằng dữ liệu
    • Thúc đẩy đa dạng
    • Kỹ thuật giảm thiên lệch: thêm ví dụ đa dạng hơn

Thiên lệch dữ liệu

  • Ví dụ:

    • "The nurse said that..." -> "she" hoặc "her"
Các khái niệm về Large Language Models (LLMs)

Quyền riêng tư dữ liệu

  • Tuân thủ quy định về bảo vệ dữ liệu và quyền riêng tư

 

  • Quyền riêng tư là mối quan ngại
    • Huấn luyện trên dữ liệu không có phép có thể gây vi phạm
    • Hậu quả pháp lý, tài chính và danh tiếng
  • Thông tin nhạy cảm hoặc định danh cá nhân (PII)

 

  • Hãy xin phép

Quyền riêng tư dữ liệu

Các khái niệm về Large Language Models (LLMs)

Ayo berlatih!

Các khái niệm về Large Language Models (LLMs)

Preparing Video For Download...