Тонке налаштування

Концепції Large Language Models (LLMs)

Vidhi Chugh

AI strategist and ethicist

Де ми зараз?

Діаграма прогресу: ми на етапі тонкого налаштування

Концепції Large Language Models (LLMs)

 

  • Попереднє тренування

Зображення: школярі як аналогія попереднього тренування

          Шкільна освіта

 

  • Тонке налаштування

Зображення: студенти як аналогія тонкого налаштування

        Університетська спеціалізація
1 Freepik
Концепції Large Language Models (LLMs)

Виклики «величини»

  • Тонке налаштування може допомогти
  • Потужні комп'ютери
  • Ефективні методи тренування моделей
  • Великі обсяги тренувальних даних

Зображення: доступність даних, час навчання та обчислювальна потужність як виклики під час створення LLM

Концепції Large Language Models (LLMs)

Обчислювальна потужність

  • Пам'ять

  • Обчислювальна потужність

  • Інфраструктура

  • Висока вартість

  • LLM:
    • сотні тисяч Central Processing Units (CPUs)
    • десятки тисяч Graphic Processing Units (GPUs)
  • Персональний комп'ютер: 4–8 CPU і 1–2 GPU

Чоловік працює за комп'ютером, під'єднаним до великого сервера

1 Freepik
Концепції Large Language Models (LLMs)

Ефективне навчання моделей

Ілюстрація, що символізує модель глибокого навчання

  • Час навчання величезний

 

  • Це може тривати тижні чи навіть місяці

 

  • Ефективне навчання моделі = швидше тренування

 

  • 355 років обчислювального часу на одній GPU
Концепції Large Language Models (LLMs)

Доступність даних

 

  • Потрібні якісні дані
  • Щоб опанувати складнощі та нюанси мови
  • Кілька сотень гігабайтів (GB) тексту

    • Понад мільйон книжок
  • Величезні обсяги даних

  Дві купи переповнених тек — символ великих даних

Концепції Large Language Models (LLMs)

Подолання викликів

  • Тонке налаштування
    • Знімає частину цих викликів
    • Адаптує попередньо натреновану модель

 

  • Попередньо натренована модель
    • Навчена на загальних наборах даних
    • Не оптимізована під конкретні завдання
    • Її можна донавчити під конкретну задачу

Люди працюють на гігантському ноутбуці з інструментами й шестернями — символ тонкого налаштування

Концепції Large Language Models (LLMs)

Тонке налаштування vs попереднє тренування

  • Тонке налаштування

  • Обчислення

    • 1–2 CPU і GPU

 

  • Час навчання
    • Від годин до днів

 

  • Дані
    • ~1 гігабайт
  • Попереднє тренування

  • Обчислення

    • Тисячі CPU та GPU

 

  • Час навчання
    • Від тижнів до місяців

 

  • Дані
    • Сотні гігабайтів
Концепції Large Language Models (LLMs)

Давайте потренуємось!

Концепції Large Language Models (LLMs)

Preparing Video For Download...