~8 хв

Що таке модель ШІ простими словами: параметри та ваги

Гігантський автодоповнювач з мільярдами ручок налаштування

Що таке мовна модель ШІ простими словами: вона вгадує наступне слово, а параметри (ваги) - її налаштування, яких мільярди. Більше - розумніше, але дорожче.

Мовна модель простими словами: це автодоповнення

Памʼятаєш підказки на клавіатурі телефона? Набираєш «дякую за» - а вона вже пхає тобі «увагу». Так от, мовна модель - рівно те саме автодоповнення. Тільки роздуте до жахливих розмірів і натреноване на горі тексту розміром із пів інтернету.

Завдання в неї до образливого просте: вгадати, який шматочок тексту йде наступним. Ти даєш початок - вона добудовує найімовірніше продовження. Потім ще шматочок. І ще. І ще. А з цього скромного «вгадай далі» виростають і відповіді на запитання, і код, і вірші на день народження тещі.

Гігантський автодоповнювач: рука друкує фразу, а величезна машина добудовує наступний шматочок тексту
Мовна модель - це автодоповнення на максималках. Дай початок - отримай продовження.

Навіщо розуміти, як працює нейромережа

Користуватися ШІ можна й наосліп. Але тоді кожна його дивина здаватиметься то магією, то поломкою. А варто вхопити базу - і багато що клацає на свої місця.

  • Перестанеш вимагати неможливого. Модель не «лізе в довідник» - вона добудовує ймовірне продовження. Звідси й вигадки на рівному місці.
  • Зрозумієш, чому одна модель розумніша за іншу і чому за розум доводиться доплачувати.
  • Навчишся читати назви. 7B, 70B, 405B перестануть бути беззмістовним шумом.
  • Зробиш усвідомлений вибір далі в курсі: де вистачить легкої моделі, а де без важкої не обійтися.

Девʼять із десяти розчарувань у ШІ - це коли від «всезнаючого розуму» чекають чудес, а насправді штука просто дуже розумно вгадує наступний шматочок тексту. Збав градус магії - і піде стабільний результат.

Як працює модель ШІ: токени, ваги та навчання

Розбираємо по кісточках, без формул. Ідей усього три, і всі прості.

Що таке токен: модель працює не словами

Усередині модель бачить текст не як слова, а як токени - шматочки слів. Коротке слово може бути одним токеном. Довге й рідкісне - розлітається на кілька. Для тебе це дрібна деталь, але запамʼятай: коли кажуть «модель передбачає слово», технічно вона передбачає наступний токен.

Що таке параметри та ваги моделі

Усередині моделі - гігантська сітка чисел. Кожне таке число і є параметр, він же вага. Уяви мікшерний пульт звукорежисера, весь утиканий ручками гучності. Тільки у звичайного пульта ручок пара десятків. А в моделі - мільярди.

Кожна ручка трішки впливає на те, який токен модель вважатиме ймовірним далі. Сама по собі одна ручка не значить майже нічого. Але всі разом мільярди ручок кодують граматику, факти, стиль, логіку - усе, що модель будь-коли вивчила.

Як навчається нейромережа: автопідкручування ручок

Руками мільярди ручок ніхто не виставляє - це фізично неможливо. Роблять інакше. Моделі вивалюють гору тексту, ховають наступний шматочок і кажуть: вгадай. Угадала криво - спеціальний алгоритм трішки підкручує ручки в бік правильної відповіді. І так незліченну кількість разів.

Поступово ручки вибудовуються так, що модель угадує дедалі точніше. Ось це і є «навчання». Жодного розуміння по-людськи - просто дуже довге й дуже дороге підганяння чисел під одне завдання: вгадай наступне.

Величезний мікшерний пульт із безліччю ручок, рука підкручує їх у бік правильної відповіді
Навчання - це автопідкручування мільярдів ручок, доки модель не почне вгадувати добре.

Більше параметрів - розумніше, але не безкоштовно

Грубе правило: що більше параметрів, то модель здібніша. Більше ручок - більше нюансів вона ловить: тонше відчуває контекст, краще міркує, рідше плутається в показаннях.

Але за це платять. Кожен шматочок відповіді - це прогін крізь усі мільярди чисел разом. Що їх більше, то дорожче й повільніше. Безкоштовного розуму не буває.

Що дає велика модель
  • Розумніша - краще міркує, тримає довгий контекст, тонше розуміє запит.
  • Ширший кругозір - у мільярдах ручок умістилося більше фактів і стилів.
  • Стабільніша на складних завданнях, де легка модель просто ламається.
Чим за це платиш
  • Дорожча - більше обчислень на кожну відповідь, вища ціна за запит.
  • Повільніша - відповідь друкується довше, особливо якщо вона довга.
  • Ненажерливіша - важку модель на звичайному ноутбуці не запустиш, потрібне потужне залізо.

Як читати назву моделі: що означає 7B і 70B

Обираєш модель - і в назві стирчить цифра з літерою B: 7B, 13B, 70B, 405B. Розшифровується елементарно.

Як читати розмір моделі

B - це billion, мільярд. Цифра перед B - кількість параметрів у мільярдах. 7B - близько семи мільярдів параметрів. Легка та прудка, на розум скромна. Часто запускається навіть локально. 70B - порядку сімдесяти мільярдів. Помітно розумніша, але потрібна серйозна відеокарта чи хмара. 405B і вище - важковаговики. Дуже здібні, але дорогі й зазвичай живуть лише в хмарі. Висновок: цифра - це приблизний «розмір мозку». Більша цифра - розумніше й дорожче. Підбирай під завдання.

Часті помилки новачка в роботі з ШІ

  • Думати, що модель «знає» факти як база даних. Вона не дістає відповідь зі сховища - вона добудовує ймовірне продовження. Тому може з чесним обличчям вигадати. Це не баг, це її природа.
  • Плутати параметри з памʼяттю чи швидкістю інтернету. Параметри - це розмір самого «мозку» моделі. А не скільки в тебе оперативки і який канал.
  • Вважати, що «більше параметрів» завжди краще. Для простого завдання це зайві гроші й зайве очікування. Розмір - під завдання, і крапка.
  • Вірити, що всередині йде мислення чи свідомість. Усередині - перемноження чисел і статистика в промисловому масштабі. Вражає? Так. Але це не розум.
  • Чекати дослівно однакову відповідь на одне й те саме запитання. Модель обирає наступний токен із дещицею випадковості, тому відповіді трохи гуляють. Це нормально й налаштовується.

TL;DR - если коротко

  • Мовна модель - це гігантський автодоповнювач. Уся її робота: вгадати наступний шматочок тексту. Решта виростає звідти.
  • Параметри (вони ж ваги) - внутрішні «ручки» моделі. Їх мільярди, і в них зашито все, що вона вивчила.
  • Навчання - це автопідкручування цих ручок, доки вгадування не стане добрим. Руками їх ніхто не крутить.
  • Більше параметрів - зазвичай розумніше. Але дорожче й повільніше. Завжди компроміс.
  • Цифра з літерою B у назві (7B, 70B) - кількість параметрів у мільярдах. B - billion.
  • Свідомості всередині немає. Це статистика й перемноження чисел у промисловому масштабі.

Пошук по вікі

Натисніть Esc для закриття

Введіть запит для миттєвого пошуку по всіх сторінках курсів та уроків.