Как выбрать локальную модель ИИ под своё железо
Семейства, размер параметров и квантизация Q4/Q5/Q8 - на пальцах
Как выбрать локальную модель ИИ: разбираем семейства (Llama, Qwen, Mistral, Gemma), число параметров 7B-70B и квантизацию Q4/Q5/Q8 под VRAM твоего компа.
Что значат цифры в названии модели
Ты решил завести ИИ дома, на своём компе. Открываешь каталог моделей - а там сотни строк вроде Llama-3-8B-Instruct-Q4. Выглядит как пароль от вай-фая соседа. Спокойно.
В этой абракадабре спрятаны всего три вещи. Сейчас научишься читать её как этикетку на пачке хлопьев. Проще всего - через выбор машины в автосалоне:
- Семейство - это марка: Toyota, BMW, Lada. У нас - Llama, Qwen, Mistral, Gemma.
- Размер (число параметров) - объём двигателя: 1.6 литра или 5.0. У нас - 7B, 14B, 70B.
- Квантизация - комплектация: базовая полегче или топовая потяжелее. У нас - Q4, Q5, Q8.
Зачем разбираться в выборе модели
Можно скачать первую попавшуюся по совету из чата. Иногда повезёт. А чаще как? Либо она не запустится - не хватит памяти. Либо запустится, но будет думать минуту над словом «привет». Либо окажется тупенькой - и ты решишь, что весь этот локальный ИИ пустая затея.
А научишься читать названия - и вот что получишь:
- Перестанешь качать гигабайты впустую - сразу видно, что влезет, а что нет.
- Не будешь винить «слабый комп» там, где просто взял модель не того размера.
- Сможешь осознанно менять скорость на ум: где-то нужна шустрая, где-то поумнее.
- Любой новый релиз для тебя - это те же три цифры. Названия меняются, логика выбора - нет.
Девять из десяти жалоб в духе «локальный ИИ тупой и медленный» - это не про ИИ. Это про модель на два размера больше, чем тянет железо. Поправишь это - и всё заиграет.
Семейства моделей: Llama, Qwen, Mistral, Gemma
Семейство Семейство (модельное семейство) - линейка моделей от одного разработчика, обученных по общему рецепту. Внутри семейства бывают разные размеры. Llama, Qwen, Mistral, Gemma - это семейства. - это кто и по какому рецепту обучил модель. Все они открытые: веса можно скачать и крутить у себя. А вот характеры разные. Грубыми мазками, без привязки к конкретным версиям:
- Llama (от Meta) - заслуженный «фольксваген» сцены. Огромное сообщество, тонна готовых настроек и дообучений под что угодно. Сомневаешься - начни отсюда.
- Qwen (от Alibaba) - сильная и универсальная линейка. Особенно хороша в коде и в куче языков, русский в их числе. Часто берут как рабочую лошадку по умолчанию.
- Mistral (французы) - мастера выжимать много ума из скромного размера. Эффективные и шустрые.
- Gemma (от Google) - аккуратные, дружелюбные, спокойно живут на одной видеокарте. Бывают и с пониманием картинок.
Размер модели: что такое число параметров (7B, 14B, 70B)
В названии почти всегда стоит буква B с цифрой: 7B, 8B, 14B, 70B. B - это billion, миллиарды параметров Параметры - настроечные ручки внутри модели, выставленные при обучении. Чем их больше, тем тоньше модель улавливает смысл, но тем больше памяти ей нужно. Измеряются в миллиардах (B). . Считай это размером мозга. Или объёмом двигателя - кому как ближе.
- Больше параметров - модель умнее, лучше держит длинные рассуждения, реже несёт чушь. Но и памяти жрёт больше, и думает медленнее.
- Меньше параметров - быстрее и легче, влезет почти куда угодно. Зато проще: на сложной задаче может поплыть.
Грубый ориентир по весовым категориям:
- Малыши (примерно 1B-4B) - летают даже на слабом железе и без видеокарты. Для простого: суммаризация, болталка, черновики.
- Середнячки (примерно 7B-14B) - золотая середина. Уже заметно умнее, но ещё влезают в обычную игровую видеокарту. Лучший старт для большинства.
- Тяжеловесы (примерно 30B-70B) - ощутимо умнее, но просят много памяти и/или мощную видеокарту. Не первый твой выбор.
- Гиганты (100B и выше) - это уже про серверное железо или особые экономные архитектуры. Дома без специальной подготовки - мимо.
Квантизация Q4, Q5, Q8: сжатие модели почти без потерь
Вот тут пугаются сильнее всего. И зря. Квантизация Квантизация - сжатие модели: её внутренние числа хранят с меньшей точностью (например, 4 бита вместо 16). Файл становится меньше, памяти нужно меньше, а ум почти не страдает. Обозначается Q4, Q5, Q8. - это просто сжатие модели. Как mp3 для музыки или JPEG для фото.
Исходная модель хранит каждое своё число очень точно - оттого и весит гигантски. Квантизация эти числа округляет: вместо длинного «3.14159265» оставляет короткое «3.14». Файл резко худеет, памяти нужно меньше, а на ответах разница почти не видна. Цифра после Q говорит, сколько битов точности осталось:
- Q8 - почти оригинал. Самый тяжёлый из сжатых, на глаз от несжатой не отличишь. Бери, если памяти вагон.
- Q5 - чуть легче, ум практически не страдает. Отличный вариант, когда памяти хватает с запасом.
- Q4 - самая популярная золотая середина. Файл уже в разы меньше оригинала, а качество держится почти полностью. Сомневаешься - бери это.
- Q3 и ниже - совсем ужатые. Для слабого железа, когда иначе вообще не влезает. Модель заметно глупеет, но лучше так, чем никак.
Как подобрать модель под VRAM и оперативку: пошагово
Вопрос не «какая модель лучшая», а «что влезет в мою память и будет шевелиться». Запомни одно слово - VRAM VRAM - видеопамять, встроенная в видеокарту. Модель работает быстрее всего, когда целиком помещается в VRAM. Если не влезает - часть уходит в обычную оперативку (RAM), и всё замедляется. . Это память твоей видеокарты, и именно она тут главная.
- Узнай свой потолок памяти. Есть видеокарта - смотри её объём VRAM (например, 8 или 12 гигабайт). Видеокарты нет или она слабая - ориентируйся на объём обычной оперативки (RAM), но готовься, что будет медленнее.
- Прикинь, что влезает. Грубое правило: файл модели должен быть меньше твоей памяти, и ещё оставь пару гигабайт сверху на запас. Файл на 5 гигабайт в видеокарту на 8 - влезет с комфортом.
- Начни с середнячка в кванте Q4. Модель на 7-8 миллиардов параметров в Q4 - это примерно 4-6 гигабайт файла и отличный старт для большинства машин.
- Подстрой по ощущениям. Памяти осталось много и хочется поумнее - подними квант до Q5 или возьми модель крупнее. Тормозит или не влезает - спустись на размер ниже или на квант полегче.
Частые ошибки при выборе локальной модели
- Гнаться за самой большой моделью. 70B на домашней видеокарте выдаёт по слову раз в пару секунд. Начни с 7-8B, нащупаешь свои потребности - вырастешь.
- Качать несжатую версию. Без квантизации модель весит в разы больше и почти наверняка не влезет. Для дома бери GGUF в кванте Q4 или Q5, не оригинал.
- Забыть про запас памяти. Модель влезла впритык - системе и контексту места не осталось, всё начнёт тормозить или падать. Оставляй пару гигабайт сверху.
- Брать Q2-Q3 без нужды. Сильно ужатая модель глупеет. Минимальный квант - только если иначе вообще никак.
- Зацикливаться на «самом топовом семействе». Рейтинги устаревают за месяц. Любая популярная модель среднего размера прекрасно подходит для старта.
- Игнорировать лицензию для коммерции. Дома неважно. В продукте - загляни в условия конкретной модели заранее.
TL;DR - если коротко
- Семейство - марка машины: Llama, Qwen, Mistral, Gemma. Характер у каждой свой, а руль везде один.
- Число параметров (7B, 14B, 70B) - объём двигателя. Больше - умнее, но и памяти жрёт больше.
- Квантизация (Q4/Q5/Q8) - сжатие модели. Q4 лёгкая и быстрая, Q8 тяжёлая и точная, Q4-Q5 - золотая середина.
- Всё упирается в память видеокарты (VRAM). Мало её - спасает оперативка, но платишь скоростью.
- Правило простое: модель должна влезать с запасом. Не влезла - бери размер поменьше или квант полегче.
- Шустрая 8B бьёт тормозящую 70B. Та, которой пользуешься, всегда полезнее той, что выключил через день.