~9 мин

Как выбрать локальную модель ИИ под своё железо

Семейства, размер параметров и квантизация Q4/Q5/Q8 - на пальцах

Как выбрать локальную модель ИИ: разбираем семейства (Llama, Qwen, Mistral, Gemma), число параметров 7B-70B и квантизацию Q4/Q5/Q8 под VRAM твоего компа.

Что значат цифры в названии модели

Ты решил завести ИИ дома, на своём компе. Открываешь каталог моделей - а там сотни строк вроде Llama-3-8B-Instruct-Q4. Выглядит как пароль от вай-фая соседа. Спокойно.

В этой абракадабре спрятаны всего три вещи. Сейчас научишься читать её как этикетку на пачке хлопьев. Проще всего - через выбор машины в автосалоне:

  • Семейство - это марка: Toyota, BMW, Lada. У нас - Llama, Qwen, Mistral, Gemma.
  • Размер (число параметров) - объём двигателя: 1.6 литра или 5.0. У нас - 7B, 14B, 70B.
  • Квантизация - комплектация: базовая полегче или топовая потяжелее. У нас - Q4, Q5, Q8.
Автосалон, где вместо машин стоят коробки-модели разного размера с ярлыками семейства и комплектации
Выбор модели - как выбор машины: марка, объём двигателя, комплектация.

Зачем разбираться в выборе модели

Можно скачать первую попавшуюся по совету из чата. Иногда повезёт. А чаще как? Либо она не запустится - не хватит памяти. Либо запустится, но будет думать минуту над словом «привет». Либо окажется тупенькой - и ты решишь, что весь этот локальный ИИ пустая затея.

А научишься читать названия - и вот что получишь:

  • Перестанешь качать гигабайты впустую - сразу видно, что влезет, а что нет.
  • Не будешь винить «слабый комп» там, где просто взял модель не того размера.
  • Сможешь осознанно менять скорость на ум: где-то нужна шустрая, где-то поумнее.
  • Любой новый релиз для тебя - это те же три цифры. Названия меняются, логика выбора - нет.

Девять из десяти жалоб в духе «локальный ИИ тупой и медленный» - это не про ИИ. Это про модель на два размера больше, чем тянет железо. Поправишь это - и всё заиграет.

Семейства моделей: Llama, Qwen, Mistral, Gemma

Семейство - это кто и по какому рецепту обучил модель. Все они открытые: веса можно скачать и крутить у себя. А вот характеры разные. Грубыми мазками, без привязки к конкретным версиям:

  • Llama (от Meta) - заслуженный «фольксваген» сцены. Огромное сообщество, тонна готовых настроек и дообучений под что угодно. Сомневаешься - начни отсюда.
  • Qwen (от Alibaba) - сильная и универсальная линейка. Особенно хороша в коде и в куче языков, русский в их числе. Часто берут как рабочую лошадку по умолчанию.
  • Mistral (французы) - мастера выжимать много ума из скромного размера. Эффективные и шустрые.
  • Gemma (от Google) - аккуратные, дружелюбные, спокойно живут на одной видеокарте. Бывают и с пониманием картинок.

Размер модели: что такое число параметров (7B, 14B, 70B)

В названии почти всегда стоит буква B с цифрой: 7B, 8B, 14B, 70B. B - это billion, миллиарды параметров . Считай это размером мозга. Или объёмом двигателя - кому как ближе.

  • Больше параметров - модель умнее, лучше держит длинные рассуждения, реже несёт чушь. Но и памяти жрёт больше, и думает медленнее.
  • Меньше параметров - быстрее и легче, влезет почти куда угодно. Зато проще: на сложной задаче может поплыть.

Грубый ориентир по весовым категориям:

С чего реально начать
  • Малыши (примерно 1B-4B) - летают даже на слабом железе и без видеокарты. Для простого: суммаризация, болталка, черновики.
  • Середнячки (примерно 7B-14B) - золотая середина. Уже заметно умнее, но ещё влезают в обычную игровую видеокарту. Лучший старт для большинства.
Куда тянет, но подумай дважды
  • Тяжеловесы (примерно 30B-70B) - ощутимо умнее, но просят много памяти и/или мощную видеокарту. Не первый твой выбор.
  • Гиганты (100B и выше) - это уже про серверное железо или особые экономные архитектуры. Дома без специальной подготовки - мимо.

Квантизация Q4, Q5, Q8: сжатие модели почти без потерь

Вот тут пугаются сильнее всего. И зря. Квантизация - это просто сжатие модели. Как mp3 для музыки или JPEG для фото.

Исходная модель хранит каждое своё число очень точно - оттого и весит гигантски. Квантизация эти числа округляет: вместо длинного «3.14159265» оставляет короткое «3.14». Файл резко худеет, памяти нужно меньше, а на ответах разница почти не видна. Цифра после Q говорит, сколько битов точности осталось:

  • Q8 - почти оригинал. Самый тяжёлый из сжатых, на глаз от несжатой не отличишь. Бери, если памяти вагон.
  • Q5 - чуть легче, ум практически не страдает. Отличный вариант, когда памяти хватает с запасом.
  • Q4 - самая популярная золотая середина. Файл уже в разы меньше оригинала, а качество держится почти полностью. Сомневаешься - бери это.
  • Q3 и ниже - совсем ужатые. Для слабого железа, когда иначе вообще не влезает. Модель заметно глупеет, но лучше так, чем никак.
Ползунок-компромисс между размером файла и качеством: Q3 слева, Q8 справа, бегунок в зоне Q4-Q5
Квантизация - это ползунок «размер против качества». Q4-Q5 - рабочая зона.

Как подобрать модель под VRAM и оперативку: пошагово

Вопрос не «какая модель лучшая», а «что влезет в мою память и будет шевелиться». Запомни одно слово - VRAM . Это память твоей видеокарты, и именно она тут главная.

Подбор модели за 4 шага
  1. Узнай свой потолок памяти. Есть видеокарта - смотри её объём VRAM (например, 8 или 12 гигабайт). Видеокарты нет или она слабая - ориентируйся на объём обычной оперативки (RAM), но готовься, что будет медленнее.
  2. Прикинь, что влезает. Грубое правило: файл модели должен быть меньше твоей памяти, и ещё оставь пару гигабайт сверху на запас. Файл на 5 гигабайт в видеокарту на 8 - влезет с комфортом.
  3. Начни с середнячка в кванте Q4. Модель на 7-8 миллиардов параметров в Q4 - это примерно 4-6 гигабайт файла и отличный старт для большинства машин.
  4. Подстрой по ощущениям. Памяти осталось много и хочется поумнее - подними квант до Q5 или возьми модель крупнее. Тормозит или не влезает - спустись на размер ниже или на квант полегче.

Частые ошибки при выборе локальной модели

  • Гнаться за самой большой моделью. 70B на домашней видеокарте выдаёт по слову раз в пару секунд. Начни с 7-8B, нащупаешь свои потребности - вырастешь.
  • Качать несжатую версию. Без квантизации модель весит в разы больше и почти наверняка не влезет. Для дома бери GGUF в кванте Q4 или Q5, не оригинал.
  • Забыть про запас памяти. Модель влезла впритык - системе и контексту места не осталось, всё начнёт тормозить или падать. Оставляй пару гигабайт сверху.
  • Брать Q2-Q3 без нужды. Сильно ужатая модель глупеет. Минимальный квант - только если иначе вообще никак.
  • Зацикливаться на «самом топовом семействе». Рейтинги устаревают за месяц. Любая популярная модель среднего размера прекрасно подходит для старта.
  • Игнорировать лицензию для коммерции. Дома неважно. В продукте - загляни в условия конкретной модели заранее.
Шкатулка-чек-лист с тремя ячейками: семейство, размер, квантизация - все три галочки проставлены
Три галочки - и модель выбрана. Семейство, размер, квантизация: больше ничего и не нужно.

TL;DR - если коротко

  • Семейство - марка машины: Llama, Qwen, Mistral, Gemma. Характер у каждой свой, а руль везде один.
  • Число параметров (7B, 14B, 70B) - объём двигателя. Больше - умнее, но и памяти жрёт больше.
  • Квантизация (Q4/Q5/Q8) - сжатие модели. Q4 лёгкая и быстрая, Q8 тяжёлая и точная, Q4-Q5 - золотая середина.
  • Всё упирается в память видеокарты (VRAM). Мало её - спасает оперативка, но платишь скоростью.
  • Правило простое: модель должна влезать с запасом. Не влезла - бери размер поменьше или квант полегче.
  • Шустрая 8B бьёт тормозящую 70B. Та, которой пользуешься, всегда полезнее той, что выключил через день.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.