Что такое модель ИИ простыми словами: параметры и веса
Гигантский автодополнитель с миллиардами ручек настройки
Что такое языковая модель ИИ простыми словами: она угадывает следующее слово, а параметры (веса) - её настройки, которых миллиарды. Больше - умнее, но дороже.
Языковая модель простыми словами: это автодополнение
Помнишь подсказки на клавиатуре телефона? Набираешь «спасибо за» - а она уже суёт тебе «внимание». Так вот, языковая модель - ровно то же автодополнение. Только раздутое до чудовищных размеров и натренированное на горе текста размером с половину интернета.
Задача у неё до обидного простая: угадать, какой кусочек текста идёт следующим. Ты даёшь начало - она достраивает самое вероятное продолжение. Потом ещё кусочек. И ещё. И ещё. А из этого скромного «угадай дальше» вырастают и ответы на вопросы, и код, и стихи на день рождения тёщи.
Зачем понимать, как работает нейросеть
Пользоваться ИИ можно и вслепую. Но тогда каждая его странность будет казаться то магией, то поломкой. А стоит ухватить базу - и многое щёлкает на свои места.
- Перестанешь требовать невозможного. Модель не «лезет в справочник» - она достраивает вероятное продолжение. Отсюда и выдумки на ровном месте.
- Поймёшь, почему одна модель умнее другой и почему за ум приходится доплачивать.
- Научишься читать названия. 7B, 70B, 405B Параметр (он же вес) - одно число внутри модели, маленькая «ручка настройки». Из миллиардов таких ручек и состоит вся модель; в них закодировано всё, что она «выучила». перестанут быть бессмысленным шумом.
- Сделаешь осознанный выбор дальше в курсе: где хватит лёгкой модели, а где без тяжёлой не обойтись.
Девять из десяти разочарований в ИИ - это когда от «всезнающего разума» ждут чудес, а на деле штука просто очень умно угадывает следующий кусочек текста. Убавь градус магии - и результат станет заметно стабильнее.
Как работает модель ИИ: токены, веса и обучение
Разбираем по косточкам, без формул. Идей всего три, и все простые.
Что такое токен: модель работает не словами
Внутри модель видит текст не как слова, а как токены Токен (token) - кусочек текста, которым оперирует модель. Иногда это целое слово, иногда часть слова или даже один символ. Модель предсказывает именно следующий токен, а не слово целиком. - кусочки слов. Короткое слово может быть одним токеном. Длинное и редкое - разлетается на несколько. Для тебя это мелкая деталь, но запомни: когда говорят «модель предсказывает слово», технически она предсказывает следующий токен.
Что такое параметры и веса модели
Внутри модели - гигантская сетка чисел. Каждое такое число и есть параметр, он же вес. Представь микшерный пульт звукорежиссёра, весь утыканный ручками громкости. Только у обычного пульта ручек пара десятков. А у модели - миллиарды.
Каждая ручка чуть-чуть влияет на то, какой токен модель сочтёт вероятным дальше. Сама по себе одна ручка не значит почти ничего. Но все вместе миллиарды ручек кодируют грамматику, факты, стиль, логику - всё, что модель когда-либо выучила.
Как обучается нейросеть: автоподкрутка ручек
Руками миллиарды ручек никто не выставляет - это физически невозможно. Делают иначе. Модели вываливают гору текста, прячут следующий кусочек и говорят: угадай. Угадала криво - специальный алгоритм чуть-чуть подкручивает ручки в сторону правильного ответа. И так несчётное число раз.
Постепенно ручки выстраиваются так, что модель угадывает всё точнее. Вот это и есть «обучение». Никакого понимания по-человечески - просто очень долгая и очень дорогая подгонка чисел под одну задачу: угадай следующее.
Больше параметров - умнее, но не бесплатно
Ориентир простой: чем больше параметров, тем модель способнее. Больше ручек - больше нюансов она ловит: тоньше чувствует контекст, лучше рассуждает, реже путается в показаниях.
Но за это платят. Каждый кусочек ответа - это прогон через все миллиарды чисел разом. Чем их больше, тем дороже и медленнее. Бесплатного ума не бывает.
- Умнее - лучше рассуждает, держит длинный контекст, тоньше понимает запрос.
- Шире кругозор - в миллиардах ручек уместилось больше фактов и стилей.
- Стабильнее на сложных задачах, где лёгкая модель попросту ломается.
- Дороже - больше вычислений на каждый ответ, выше цена за запрос.
- Медленнее - ответ печатается дольше, особенно если он длинный.
- Прожорливее - тяжёлую модель на обычном ноутбуке не запустишь, нужно мощное железо.
Как читать название модели: что значит 7B и 70B
Выбираешь модель - и в названии торчит цифра с буквой B: 7B, 13B, 70B, 405B. Расшифровывается элементарно.
B - это billion, миллиард. Цифра перед B - число параметров в миллиардах.
7B - около семи миллиардов параметров. Лёгкая и шустрая, по уму скромная. Часто запускается даже локально.
70B - порядка семидесяти миллиардов. Заметно умнее, но нужна серьёзная видеокарта или облако.
405B и выше - тяжеловесы. Очень способные, но дорогие и обычно живут только в облаке.
Вывод: цифра - это примерный «размер мозга». Больше цифра - умнее и дороже. Подбирай под задачу.
Частые ошибки новичка в работе с ИИ
- Думать, что модель «знает» факты как база данных. Она не достаёт ответ из хранилища - она достраивает вероятное продолжение. Поэтому может с честным лицом выдумать. Это не баг, это её природа.
- Путать параметры с памятью или скоростью интернета. Параметры - это размер самого «мозга» модели. А не сколько у тебя оперативки и какой канал.
- Считать, что «больше параметров» всегда лучше. Для простой задачи это лишние деньги и лишнее ожидание. Размер - под задачу, и точка.
- Верить, что внутри идёт мышление или сознание. Внутри - перемножение чисел и статистика в промышленном масштабе. Впечатляет? Да. Но это не разум.
- Ждать дословно одинаковый ответ на один и тот же вопрос. Модель выбирает следующий токен с долей случайности, поэтому ответы слегка гуляют. Это нормально и настраивается.
TL;DR - если коротко
- Языковая модель - это гигантский автодополнитель. Вся её работа: угадать следующий кусочек текста. Остальное растёт оттуда.
- Параметры (они же веса) - внутренние «ручки» модели. Их миллиарды, и в них зашито всё, что она выучила.
- Обучение - это автоподкрутка этих ручек, пока угадывание не станет хорошим. Руками их никто не крутит.
- Больше параметров - обычно умнее. Но дороже и медленнее. Всегда компромисс.
- Цифра с буквой B в названии (7B, 70B) - число параметров в миллиардах. B - billion.
- Сознания внутри нет. Это статистика и перемножение чисел в промышленном масштабе.