~9 хв

Як вибрати локальну модель ШІ під своє залізо

Сімейства, розмір параметрів і квантизація Q4/Q5/Q8 - на пальцях

Як вибрати локальну модель ШІ: розбираємо сімейства (Llama, Qwen, Mistral, Gemma), кількість параметрів 7B-70B і квантизацію Q4/Q5/Q8 під VRAM твого компа.

Що означають цифри в назві моделі

Ти вирішив завести ШІ вдома, на своєму компі. Відкриваєш каталог моделей - а там сотні рядків на кшталт Llama-3-8B-Instruct-Q4. Виглядає як пароль від вай-фаю сусіда. Спокійно.

У цій абракадабрі заховано всього три речі. Зараз навчишся читати її як етикетку на пачці пластівців. Найпростіше - через вибір машини в автосалоні:

  • Сімейство - це марка: Toyota, BMW, Lada. У нас - Llama, Qwen, Mistral, Gemma.
  • Розмір (кількість параметрів) - обʼєм двигуна: 1.6 літра чи 5.0. У нас - 7B, 14B, 70B.
  • Квантизація - комплектація: базова легша чи топова важча. У нас - Q4, Q5, Q8.
Автосалон, де замість машин стоять коробки-моделі різного розміру з ярликами сімейства та комплектації
Вибір моделі - як вибір машини: марка, обʼєм двигуна, комплектація.

Навіщо розбиратися у виборі моделі

Можна завантажити першу-ліпшу за порадою з чату. Іноді пощастить. А частіше як? Або вона не запуститься - не вистачить памʼяті. Або запуститься, але думатиме хвилину над словом «привіт». Або виявиться тупенькою - і ти вирішиш, що весь цей локальний ШІ - порожня витівка.

А навчишся читати назви - і ось що отримаєш:

  • Перестанеш завантажувати гігабайти намарно - одразу видно, що влізе, а що ні.
  • Не будеш винити «слабкий комп» там, де просто взяв модель не того розміру.
  • Зможеш свідомо міняти швидкість на розум: десь потрібна шустра, десь розумніша.
  • Будь-який новий реліз для тебе - це ті самі три цифри. Назви міняються, логіка вибору - ні.

Девʼять із десяти скарг у дусі «локальний ШІ тупий і повільний» - це не про ШІ. Це про модель на два розміри більшу, ніж тягне залізо. Виправиш це - і все заграє.

Сімейства моделей: Llama, Qwen, Mistral, Gemma

Сімейство - це хто і за яким рецептом навчив модель. Усі вони відкриті: ваги можна завантажити і крутити в себе. А ось характери різні. Грубими мазками, без привʼязки до конкретних версій:

  • Llama (від Meta) - заслужений «фольксваген» сцени. Величезна спільнота, тонна готових налаштувань і донавчань під що завгодно. Сумніваєшся - почни звідси.
  • Qwen (від Alibaba) - сильна й універсальна лінійка. Особливо хороша в коді та в купі мов, українська серед них. Часто беруть як робочу конячку за замовчуванням.
  • Mistral (французи) - майстри вичавлювати багато розуму зі скромного розміру. Ефективні й шустрі.
  • Gemma (від Google) - акуратні, дружелюбні, спокійно живуть на одній відеокарті. Бувають і з розумінням картинок.

Розмір моделі: що таке кількість параметрів (7B, 14B, 70B)

У назві майже завжди стоїть літера B із цифрою: 7B, 8B, 14B, 70B. B - це billion, мільярди параметрів . Вважай це розміром мозку. Або обʼємом двигуна - кому як ближче.

  • Більше параметрів - модель розумніша, краще тримає довгі міркування, рідше меле нісенітниці. Але й памʼяті жере більше, і думає повільніше.
  • Менше параметрів - швидше і легше, влізе майже куди завгодно. Зате простіша: на складній задачі може попливти.

Грубий орієнтир за ваговими категоріями:

З чого реально почати
  • Малюки (приблизно 1B-4B) - літають навіть на слабкому залізі й без відеокарти. Для простого: сумаризація, балачка, чернетки.
  • Середнячки (приблизно 7B-14B) - золота середина. Уже помітно розумніші, але ще влазять у звичайну ігрову відеокарту. Найкращий старт для більшості.
Куди тягне, але подумай двічі
  • Важковаговики (приблизно 30B-70B) - відчутно розумніші, але просять багато памʼяті та/або потужну відеокарту. Не перший твій вибір.
  • Гіганти (100B і вище) - це вже про серверне залізо чи особливі ощадливі архітектури. Удома без спеціальної підготовки - повз.

Квантизація Q4, Q5, Q8: стиснення моделі майже без втрат

Ось тут лякаються найбільше. І даремно. Квантизація - це просто стиснення моделі. Як mp3 для музики чи JPEG для фото.

Вихідна модель зберігає кожне своє число дуже точно - тому й важить гігантськи. Квантизація ці числа округлює: замість довгого «3.14159265» лишає коротке «3.14». Файл різко худне, памʼяті потрібно менше, а на відповідях різниця майже не видна. Цифра після Q каже, скільки бітів точності лишилося:

  • Q8 - майже оригінал. Найважчий зі стиснутих, на око від нестиснутої не відрізниш. Бери, якщо памʼяті вагон.
  • Q5 - трохи легше, розум практично не страждає. Чудовий варіант, коли памʼяті вистачає із запасом.
  • Q4 - найпопулярніша золота середина. Файл уже в рази менший за оригінал, а якість тримається майже повністю. Сумніваєшся - бери це.
  • Q3 і нижче - зовсім стиснуті. Для слабкого заліза, коли інакше взагалі не влазить. Модель помітно дурнішає, але краще так, ніж ніяк.
Повзунок-компроміс між розміром файлу та якістю: Q3 зліва, Q8 справа, бігунець у зоні Q4-Q5
Квантизація - це повзунок «розмір проти якості». Q4-Q5 - солодка зона.

Як підібрати модель під VRAM і оперативку: покроково

Питання не «яка модель найкраща», а «що влізе в мою памʼять і буде ворушитися». Запамʼятай одне слово - VRAM . Це памʼять твоєї відеокарти, і саме вона тут головна.

Підбір моделі за 4 кроки
  1. Дізнайся свою стелю памʼяті. Є відеокарта - дивись її обʼєм VRAM (наприклад, 8 чи 12 гігабайтів). Відеокарти немає або вона слабка - орієнтуйся на обʼєм звичайної оперативки (RAM), але готуйся, що буде повільніше.
  2. Прикинь, що влазить. Грубе правило: файл моделі має бути меншим за твою памʼять, і ще лиши пару гігабайтів зверху на запас. Файл на 5 гігабайтів у відеокарту на 8 - влізе з комфортом.
  3. Почни із середнячка в кванті Q4. Модель на 7-8 мільярдів параметрів у Q4 - це приблизно 4-6 гігабайтів файлу і чудовий старт для більшості машин.
  4. Підлаштуй за відчуттями. Памʼяті лишилося багато і хочеться розумніше - підніми квант до Q5 чи візьми модель більшу. Гальмує або не влазить - спустися на розмір нижче чи на квант легший.

Часті помилки під час вибору локальної моделі

  • Гнатися за найбільшою моделлю. 70B на домашній відеокарті видає по слову раз на пару секунд. Почни з 7-8B, намацаєш свої потреби - виростеш.
  • Завантажувати нестиснуту версію. Без квантизації модель важить у рази більше і майже напевно не влізе. Для дому бери GGUF у кванті Q4 чи Q5, не оригінал.
  • Забути про запас памʼяті. Модель влізла впритул - системі й контексту місця не лишилося, усе почне гальмувати чи падати. Лишай пару гігабайтів зверху.
  • Брати Q2-Q3 без потреби. Сильно стиснута модель дурнішає. Мінімальний квант - тільки якщо інакше взагалі ніяк.
  • Зациклюватися на «найтоповішому сімействі». Рейтинги застарівають за місяць. Будь-яка популярна модель середнього розміру чудово підходить для старту.
  • Ігнорувати ліцензію для комерції. Удома неважливо. У продукті - зазирни в умови конкретної моделі заздалегідь.
Скринька-чек-лист із трьома комірками: сімейство, розмір, квантизація - усі три галочки проставлені
Три галочки - і модель вибрана. Сімейство, розмір, квантизація: більше нічого й не потрібно.

TL;DR - если коротко

  • Сімейство - марка машини: Llama, Qwen, Mistral, Gemma. Характер у кожної свій, а кермо скрізь одне.
  • Кількість параметрів (7B, 14B, 70B) - обʼєм двигуна. Більше - розумніше, але й памʼять жере сильніше.
  • Квантизація (Q4/Q5/Q8) - стиснення моделі. Q4 легка і швидка, Q8 важка і точна, Q4-Q5 - золота середина.
  • Усе впирається в памʼять відеокарти (VRAM). Мало її - рятує оперативка, але платиш швидкістю.
  • Правило просте: модель має влазити із запасом. Не влізла - бери розмір менший або квант легший.
  • Шустра 8B бʼє гальмівну 70B. Та, якою користуєшся, завжди корисніша за ту, що вимкнув за день.

Пошук по вікі

Натисніть Esc для закриття

Введіть запит для миттєвого пошуку по всіх сторінках курсів та уроків.