~8 мин

Что такое модель ИИ простыми словами: параметры и веса

Гигантский автодополнитель с миллиардами ручек настройки

Что такое языковая модель ИИ простыми словами: она угадывает следующее слово, а параметры (веса) - её настройки, которых миллиарды. Больше - умнее, но дороже.

Языковая модель простыми словами: это автодополнение

Помнишь подсказки на клавиатуре телефона? Набираешь «спасибо за» - а она уже суёт тебе «внимание». Так вот, языковая модель - ровно то же автодополнение. Только раздутое до чудовищных размеров и натренированное на горе текста размером с половину интернета.

Задача у неё до обидного простая: угадать, какой кусочек текста идёт следующим. Ты даёшь начало - она достраивает самое вероятное продолжение. Потом ещё кусочек. И ещё. И ещё. А из этого скромного «угадай дальше» вырастают и ответы на вопросы, и код, и стихи на день рождения тёщи.

Гигантский автодополнитель: рука печатает фразу, а огромная машина достраивает следующий кусочек текста
Языковая модель - это автодополнение на максималках. Дай начало - получи продолжение.

Зачем понимать, как работает нейросеть

Пользоваться ИИ можно и вслепую. Но тогда каждая его странность будет казаться то магией, то поломкой. А стоит ухватить базу - и многое щёлкает на свои места.

  • Перестанешь требовать невозможного. Модель не «лезет в справочник» - она достраивает вероятное продолжение. Отсюда и выдумки на ровном месте.
  • Поймёшь, почему одна модель умнее другой и почему за ум приходится доплачивать.
  • Научишься читать названия. 7B, 70B, 405B перестанут быть бессмысленным шумом.
  • Сделаешь осознанный выбор дальше в курсе: где хватит лёгкой модели, а где без тяжёлой не обойтись.

Девять из десяти разочарований в ИИ - это когда от «всезнающего разума» ждут чудес, а на деле штука просто очень умно угадывает следующий кусочек текста. Убавь градус магии - и результат станет заметно стабильнее.

Как работает модель ИИ: токены, веса и обучение

Разбираем по косточкам, без формул. Идей всего три, и все простые.

Что такое токен: модель работает не словами

Внутри модель видит текст не как слова, а как токены - кусочки слов. Короткое слово может быть одним токеном. Длинное и редкое - разлетается на несколько. Для тебя это мелкая деталь, но запомни: когда говорят «модель предсказывает слово», технически она предсказывает следующий токен.

Что такое параметры и веса модели

Внутри модели - гигантская сетка чисел. Каждое такое число и есть параметр, он же вес. Представь микшерный пульт звукорежиссёра, весь утыканный ручками громкости. Только у обычного пульта ручек пара десятков. А у модели - миллиарды.

Каждая ручка чуть-чуть влияет на то, какой токен модель сочтёт вероятным дальше. Сама по себе одна ручка не значит почти ничего. Но все вместе миллиарды ручек кодируют грамматику, факты, стиль, логику - всё, что модель когда-либо выучила.

Как обучается нейросеть: автоподкрутка ручек

Руками миллиарды ручек никто не выставляет - это физически невозможно. Делают иначе. Модели вываливают гору текста, прячут следующий кусочек и говорят: угадай. Угадала криво - специальный алгоритм чуть-чуть подкручивает ручки в сторону правильного ответа. И так несчётное число раз.

Постепенно ручки выстраиваются так, что модель угадывает всё точнее. Вот это и есть «обучение». Никакого понимания по-человечески - просто очень долгая и очень дорогая подгонка чисел под одну задачу: угадай следующее.

Огромный микшерный пульт с множеством ручек, рука подкручивает их в сторону правильного ответа
Обучение - это автоподкрутка миллиардов ручек, пока модель не начнёт угадывать хорошо.

Больше параметров - умнее, но не бесплатно

Ориентир простой: чем больше параметров, тем модель способнее. Больше ручек - больше нюансов она ловит: тоньше чувствует контекст, лучше рассуждает, реже путается в показаниях.

Но за это платят. Каждый кусочек ответа - это прогон через все миллиарды чисел разом. Чем их больше, тем дороже и медленнее. Бесплатного ума не бывает.

Что даёт большая модель
  • Умнее - лучше рассуждает, держит длинный контекст, тоньше понимает запрос.
  • Шире кругозор - в миллиардах ручек уместилось больше фактов и стилей.
  • Стабильнее на сложных задачах, где лёгкая модель попросту ломается.
Чем за это платишь
  • Дороже - больше вычислений на каждый ответ, выше цена за запрос.
  • Медленнее - ответ печатается дольше, особенно если он длинный.
  • Прожорливее - тяжёлую модель на обычном ноутбуке не запустишь, нужно мощное железо.

Как читать название модели: что значит 7B и 70B

Выбираешь модель - и в названии торчит цифра с буквой B: 7B, 13B, 70B, 405B. Расшифровывается элементарно.

Как читать размер модели

B - это billion, миллиард. Цифра перед B - число параметров в миллиардах. 7B - около семи миллиардов параметров. Лёгкая и шустрая, по уму скромная. Часто запускается даже локально. 70B - порядка семидесяти миллиардов. Заметно умнее, но нужна серьёзная видеокарта или облако. 405B и выше - тяжеловесы. Очень способные, но дорогие и обычно живут только в облаке. Вывод: цифра - это примерный «размер мозга». Больше цифра - умнее и дороже. Подбирай под задачу.

Частые ошибки новичка в работе с ИИ

  • Думать, что модель «знает» факты как база данных. Она не достаёт ответ из хранилища - она достраивает вероятное продолжение. Поэтому может с честным лицом выдумать. Это не баг, это её природа.
  • Путать параметры с памятью или скоростью интернета. Параметры - это размер самого «мозга» модели. А не сколько у тебя оперативки и какой канал.
  • Считать, что «больше параметров» всегда лучше. Для простой задачи это лишние деньги и лишнее ожидание. Размер - под задачу, и точка.
  • Верить, что внутри идёт мышление или сознание. Внутри - перемножение чисел и статистика в промышленном масштабе. Впечатляет? Да. Но это не разум.
  • Ждать дословно одинаковый ответ на один и тот же вопрос. Модель выбирает следующий токен с долей случайности, поэтому ответы слегка гуляют. Это нормально и настраивается.

TL;DR - если коротко

  • Языковая модель - это гигантский автодополнитель. Вся её работа: угадать следующий кусочек текста. Остальное растёт оттуда.
  • Параметры (они же веса) - внутренние «ручки» модели. Их миллиарды, и в них зашито всё, что она выучила.
  • Обучение - это автоподкрутка этих ручек, пока угадывание не станет хорошим. Руками их никто не крутит.
  • Больше параметров - обычно умнее. Но дороже и медленнее. Всегда компромисс.
  • Цифра с буквой B в названии (7B, 70B) - число параметров в миллиардах. B - billion.
  • Сознания внутри нет. Это статистика и перемножение чисел в промышленном масштабе.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.