Як вибрати локальну модель ШІ під своє залізо
Сімейства, розмір параметрів і квантизація Q4/Q5/Q8 - на пальцях
Як вибрати локальну модель ШІ: розбираємо сімейства (Llama, Qwen, Mistral, Gemma), кількість параметрів 7B-70B і квантизацію Q4/Q5/Q8 під VRAM твого компа.
Що означають цифри в назві моделі
Ти вирішив завести ШІ вдома, на своєму компі. Відкриваєш каталог моделей - а там сотні рядків на кшталт Llama-3-8B-Instruct-Q4. Виглядає як пароль від вай-фаю сусіда. Спокійно.
У цій абракадабрі заховано всього три речі. Зараз навчишся читати її як етикетку на пачці пластівців. Найпростіше - через вибір машини в автосалоні:
- Сімейство - це марка: Toyota, BMW, Lada. У нас - Llama, Qwen, Mistral, Gemma.
- Розмір (кількість параметрів) - обʼєм двигуна: 1.6 літра чи 5.0. У нас - 7B, 14B, 70B.
- Квантизація - комплектація: базова легша чи топова важча. У нас - Q4, Q5, Q8.
Навіщо розбиратися у виборі моделі
Можна завантажити першу-ліпшу за порадою з чату. Іноді пощастить. А частіше як? Або вона не запуститься - не вистачить памʼяті. Або запуститься, але думатиме хвилину над словом «привіт». Або виявиться тупенькою - і ти вирішиш, що весь цей локальний ШІ - порожня витівка.
А навчишся читати назви - і ось що отримаєш:
- Перестанеш завантажувати гігабайти намарно - одразу видно, що влізе, а що ні.
- Не будеш винити «слабкий комп» там, де просто взяв модель не того розміру.
- Зможеш свідомо міняти швидкість на розум: десь потрібна шустра, десь розумніша.
- Будь-який новий реліз для тебе - це ті самі три цифри. Назви міняються, логіка вибору - ні.
Девʼять із десяти скарг у дусі «локальний ШІ тупий і повільний» - це не про ШІ. Це про модель на два розміри більшу, ніж тягне залізо. Виправиш це - і все заграє.
Сімейства моделей: Llama, Qwen, Mistral, Gemma
Сімейство Сімейство (модельне сімейство) - лінійка моделей від одного розробника, навчених за спільним рецептом. Усередині сімейства бувають різні розміри. Llama, Qwen, Mistral, Gemma - це сімейства. - це хто і за яким рецептом навчив модель. Усі вони відкриті: ваги можна завантажити і крутити в себе. А ось характери різні. Грубими мазками, без привʼязки до конкретних версій:
- Llama (від Meta) - заслужений «фольксваген» сцени. Величезна спільнота, тонна готових налаштувань і донавчань під що завгодно. Сумніваєшся - почни звідси.
- Qwen (від Alibaba) - сильна й універсальна лінійка. Особливо хороша в коді та в купі мов, українська серед них. Часто беруть як робочу конячку за замовчуванням.
- Mistral (французи) - майстри вичавлювати багато розуму зі скромного розміру. Ефективні й шустрі.
- Gemma (від Google) - акуратні, дружелюбні, спокійно живуть на одній відеокарті. Бувають і з розумінням картинок.
Розмір моделі: що таке кількість параметрів (7B, 14B, 70B)
У назві майже завжди стоїть літера B із цифрою: 7B, 8B, 14B, 70B. B - це billion, мільярди параметрів Параметри - налаштувальні ручки всередині моделі, виставлені під час навчання. Чим їх більше, тим тонше модель вловлює сенс, але тим більше памʼяті їй потрібно. Вимірюються в мільярдах (B). . Вважай це розміром мозку. Або обʼємом двигуна - кому як ближче.
- Більше параметрів - модель розумніша, краще тримає довгі міркування, рідше меле нісенітниці. Але й памʼяті жере більше, і думає повільніше.
- Менше параметрів - швидше і легше, влізе майже куди завгодно. Зате простіша: на складній задачі може попливти.
Грубий орієнтир за ваговими категоріями:
- Малюки (приблизно 1B-4B) - літають навіть на слабкому залізі й без відеокарти. Для простого: сумаризація, балачка, чернетки.
- Середнячки (приблизно 7B-14B) - золота середина. Уже помітно розумніші, але ще влазять у звичайну ігрову відеокарту. Найкращий старт для більшості.
- Важковаговики (приблизно 30B-70B) - відчутно розумніші, але просять багато памʼяті та/або потужну відеокарту. Не перший твій вибір.
- Гіганти (100B і вище) - це вже про серверне залізо чи особливі ощадливі архітектури. Удома без спеціальної підготовки - повз.
Квантизація Q4, Q5, Q8: стиснення моделі майже без втрат
Ось тут лякаються найбільше. І даремно. Квантизація Квантизація - стиснення моделі: її внутрішні числа зберігають з меншою точністю (наприклад, 4 біти замість 16). Файл стає меншим, памʼяті потрібно менше, а розум майже не страждає. Позначається Q4, Q5, Q8. - це просто стиснення моделі. Як mp3 для музики чи JPEG для фото.
Вихідна модель зберігає кожне своє число дуже точно - тому й важить гігантськи. Квантизація ці числа округлює: замість довгого «3.14159265» лишає коротке «3.14». Файл різко худне, памʼяті потрібно менше, а на відповідях різниця майже не видна. Цифра після Q каже, скільки бітів точності лишилося:
- Q8 - майже оригінал. Найважчий зі стиснутих, на око від нестиснутої не відрізниш. Бери, якщо памʼяті вагон.
- Q5 - трохи легше, розум практично не страждає. Чудовий варіант, коли памʼяті вистачає із запасом.
- Q4 - найпопулярніша золота середина. Файл уже в рази менший за оригінал, а якість тримається майже повністю. Сумніваєшся - бери це.
- Q3 і нижче - зовсім стиснуті. Для слабкого заліза, коли інакше взагалі не влазить. Модель помітно дурнішає, але краще так, ніж ніяк.
Як підібрати модель під VRAM і оперативку: покроково
Питання не «яка модель найкраща», а «що влізе в мою памʼять і буде ворушитися». Запамʼятай одне слово - VRAM VRAM - відеопамʼять, вбудована у відеокарту. Модель працює найшвидше, коли цілком поміщається у VRAM. Якщо не влазить - частина йде у звичайну оперативку (RAM), і все сповільнюється. . Це памʼять твоєї відеокарти, і саме вона тут головна.
- Дізнайся свою стелю памʼяті. Є відеокарта - дивись її обʼєм VRAM (наприклад, 8 чи 12 гігабайтів). Відеокарти немає або вона слабка - орієнтуйся на обʼєм звичайної оперативки (RAM), але готуйся, що буде повільніше.
- Прикинь, що влазить. Грубе правило: файл моделі має бути меншим за твою памʼять, і ще лиши пару гігабайтів зверху на запас. Файл на 5 гігабайтів у відеокарту на 8 - влізе з комфортом.
- Почни із середнячка в кванті Q4. Модель на 7-8 мільярдів параметрів у Q4 - це приблизно 4-6 гігабайтів файлу і чудовий старт для більшості машин.
- Підлаштуй за відчуттями. Памʼяті лишилося багато і хочеться розумніше - підніми квант до Q5 чи візьми модель більшу. Гальмує або не влазить - спустися на розмір нижче чи на квант легший.
Часті помилки під час вибору локальної моделі
- Гнатися за найбільшою моделлю. 70B на домашній відеокарті видає по слову раз на пару секунд. Почни з 7-8B, намацаєш свої потреби - виростеш.
- Завантажувати нестиснуту версію. Без квантизації модель важить у рази більше і майже напевно не влізе. Для дому бери GGUF у кванті Q4 чи Q5, не оригінал.
- Забути про запас памʼяті. Модель влізла впритул - системі й контексту місця не лишилося, усе почне гальмувати чи падати. Лишай пару гігабайтів зверху.
- Брати Q2-Q3 без потреби. Сильно стиснута модель дурнішає. Мінімальний квант - тільки якщо інакше взагалі ніяк.
- Зациклюватися на «найтоповішому сімействі». Рейтинги застарівають за місяць. Будь-яка популярна модель середнього розміру чудово підходить для старту.
- Ігнорувати ліцензію для комерції. Удома неважливо. У продукті - зазирни в умови конкретної моделі заздалегідь.
TL;DR - если коротко
- Сімейство - марка машини: Llama, Qwen, Mistral, Gemma. Характер у кожної свій, а кермо скрізь одне.
- Кількість параметрів (7B, 14B, 70B) - обʼєм двигуна. Більше - розумніше, але й памʼять жере сильніше.
- Квантизація (Q4/Q5/Q8) - стиснення моделі. Q4 легка і швидка, Q8 важка і точна, Q4-Q5 - золота середина.
- Усе впирається в памʼять відеокарти (VRAM). Мало її - рятує оперативка, але платиш швидкістю.
- Правило просте: модель має влазити із запасом. Не влізла - бери розмір менший або квант легший.
- Шустра 8B бʼє гальмівну 70B. Та, якою користуєшся, завжди корисніша за ту, що вимкнув за день.