Железо для локального ИИ: сколько VRAM реально нужно
Где живёт модель, сколько памяти ей подавай и что делать, когда её мало
Какое железо тянет локальные ИИ-модели: главный фактор - видеопамять VRAM, оперативка про запас, Apple Silicon с общей памятью. Прикидка под 7B, 13B и 70B плюс спасение для слабой машины.
Что такое VRAM и почему она решает всё
Локальная модель - это здоровенный файл с «мозгами». Чтобы он начал думать, его надо целиком поднять в быструю память. Вот и весь фокус.
Представь, что ты нанял повара. Он готовит быстро только тогда, когда все ингредиенты лежат у него на столе под рукой. Стол - это память видеокарты. А если половина продуктов в кладовке на другом этаже? Каждое блюдо превращается в марафон туда-обратно. Готовка встаёт.
Так вот, главный стол для ИИ - это видеокарта и её собственная память, VRAM. Не процессор. Не количество ядер. Не частота. А именно сколько гигабайт влезает в видеокарту. Правило номер один. Запомни его - и половина вопросов про железо отпадёт сама собой.
Зачем разбираться в железе перед запуском модели
Чтобы не выкинуть деньги на ветер и не разочароваться раньше времени. История знакомая до боли: человек качает самую большую и умную модель, жмёт запуск - и компьютер либо виснет, либо выдаёт по слову в минуту. Отсюда вывод «локальный ИИ - это медленно и не работает». Вывод неверный. Просто модель не влезла на стол.
- Поймёшь, какую модель твоя машина реально потянет, ещё до скачивания гигабайтов.
- Перестанешь винить «слабый комп» там, где надо было просто взять модель поменьше.
- Будешь выбирать осознанно: вот эту запущу мгновенно, а вон та не для моего железа.
- Соберёшься докупать железо - посмотришь на правильную цифру (объём VRAM), а не на маркетинг.
Девять из десяти жалоб «локальная модель жутко тормозит» - это модель, которая не влезла в VRAM и наполовину свалилась в оперативку. Разберёшься с памятью - и проблема становится видимой и решаемой.
Три вида памяти для ИИ: VRAM, RAM и CPU
В компьютере есть несколько мест, где может «жить» модель. И по скорости они отличаются как гоночная трасса от просёлка.
VRAM - память видеокарты, главный стол
VRAM VRAM (video RAM) - собственная память видеокарты, отдельная от обычной оперативки. Самая быстрая для ИИ. Именно её объём в гигабайтах определяет, какую модель ты запустишь с комфортом. - та самая быстрая память прямо на видеокарте. Видеокарта умеет считать тысячи вещей разом, поэтому модели гоняют на ней, а не на процессоре. Но стол у неё не резиновый: бывает 8, 12, 16, 24 гигабайта. Сколько именно - решает почти всё.
RAM - обычная оперативка, запасная скамейка
Оперативка RAM (оперативная память) - обычная память компьютера, та самая, которой бывает 8, 16, 32 ГБ. Для ИИ она медленнее VRAM, но в неё можно вынести часть модели, если та не влезла в видеокарту. тоже работает - но для таких задач заметно медленнее. Не влезла модель в VRAM? Программа сбрасывает «лишний хвост» в оперативку - это называется офлоад (выгрузка). Модель запустится. Только скорость просядет в разы: видеокарте придётся то и дело бегать в кладовку за каждым кусочком.
Процессор (CPU) - крайний случай
Гонять модель можно и вовсе без видеокарты, на одном процессоре с оперативкой. Заработает. Но медленно - годится разве что пощупать совсем крохотную модель. Это план «Б», а не основная дорога.
Сколько VRAM нужно для 7B, 13B и 70B
Размер модели меряют в миллиардах параметров - это и есть буква B в названиях вроде 7B, 13B, 70B (B - billion, миллиард). Грубо: чем больше параметров, тем умнее модель и тем больше памяти ей подавай.
Вот прикидка для сжатого (квантизованного) вида - именно так модели обычно и запускают локально. Цифры ориентировочные, плюс-минус, без претензии на аптекарскую точность: реальный аппетит зависит ещё и от длины контекста (сколько текста модель держит в голове за раз).
7B / 8B (маленькая, шустрая) - примерно 5-6 ГБ VRAM. Заходит даже на скромную видеокарту на 8 ГБ.
13B (средняя, поумнее) - примерно 8-10 ГБ. Комфортно на карте 12-16 ГБ.
70B (большая, реально умная) - примерно от 40 ГБ. Это уже профессиональная карта, две видеокарты или Mac с большой памятью.
Apple Silicon и общая память: почему Mac тут в плюсе
У тебя Mac на чипе серии M (M1, M2, M3, M4 и дальше)? Тогда история другая - и во многом удачная для ИИ. У этих чипов общая память: процессор и встроенная графика делят один общий пул, а не дерутся за отдельные кусочки.
Apple Silicon Apple Silicon - чипы Apple серии M (M1, M2, M3, M4 и далее). Их фишка - unified memory, общая память: процессор и графика используют один пул, поэтому графике доступно много памяти без отдельной видеокарты. с общей памятью означает вот что: сколько у тебя оперативки в Mac - почти столько же доступно и модели. Mac на 32-64 ГБ крутит то, под что на обычном ПК пришлось бы выложить кругленькую сумму за видеокарту с большим объёмом VRAM.
- Общая память: графике доступно много, без отдельной видеокарты.
- Тихо, холодно, экономно по энергии - можно крутить модель прямо на ноутбуке.
- Mac на 32-64 ГБ тянет крупные модели, недоступные средней игровой видеокарте.
- Память впаяна намертво: сколько взял при покупке - столько и будет, доставить нельзя.
- Чистая скорость на тяжёлых моделях обычно ниже, чем у топовой игровой видеокарты, зато памяти больше.
- При выборе Mac под ИИ главное - брать побольше памяти, а не топовый процессор.
Как запустить локальный ИИ на слабом компьютере
Старый ноут, встроенная графика, видеокарта на 4-6 ГБ? Не повод опускать руки. Локальный ИИ - это не «топовое железо или никак». Есть два рычага, которые вытаскивают почти всех.
Рычаг 1. Бери модель поменьше
Самое очевидное и самое работающее. Маленькая модель (вроде 7B/8B, а есть и совсем крохи на 1-3B) влезет почти куда угодно. Да, она глупее большой. Но для кучи задач - суммаризация, простые вопросы, черновики, помощь по коду - её хватает с головой. Лучше шустрая маленькая модель, чем огромная, которая еле дышит или вообще не стартует.
Рычаг 2. Квантизация - сжатие модели
Квантизация Квантизация - сжатие модели: числа внутри неё хранят грубее (например, 4 бита вместо 16). Модель занимает в памяти примерно вчетверо меньше и работает быстрее, а качество падает совсем чуть-чуть. - это когда числа внутри модели хранят менее точно, погрубее. Звучит пугающе, а на деле почти волшебство: модель занимает в памяти примерно вчетверо меньше, а отвечает почти так же хорошо. Вот почему 7B-модель влезает не в 14-16 ГБ, а в скромные 5-6 ГБ.
И приятное: руками ничего сжимать не надо. В готовых программах для запуска локальных моделей сжатые версии уже лежат на выбор - бери ту, что помечена как 4-битная (часто в названии торчит что-то вроде Q4), и всё.
Частые ошибки новичка при выборе железа
- Гнаться за самой большой моделью. 70B на видеокарте с 8 ГБ нормально не запустится. Соизмеряй размер модели со своей памятью.
- Смотреть на процессор вместо видеокарты. Для ИИ решает VRAM, а не количество ядер CPU. Крутой процессор без хорошей видеокарты модель не спасёт.
- Брать модель впритык под объём VRAM. Забыл про контекст - и в живом диалоге память кончилась. Всегда оставляй запас.
- Качать несжатую модель «чтобы получше». На слабой машине это прямой путь к зависанию. Бери квантизованную версию - разница в качестве для новичка почти незаметна.
- Думать, что без дорогой видеокарты ничего не выйдет. Маленькая сжатая модель работает даже на скромном железе и на Mac с общей памятью.
- Винить «тормозной комп». Чаще всего тормозит не комп, а слишком большая модель, свалившаяся из VRAM в оперативку.
TL;DR - если коротко
- Главный герой - видеокарта и её память VRAM. Влезла модель целиком - летает. Не влезла - ползёт.
- Прикидка в сжатом 4-битном виде: 7B/8B - 5-6 ГБ, 13B - 8-10 ГБ, 70B - от 40 ГБ.
- Оперативка (RAM) - запасная скамейка. Хвост модели можно сбросить туда, но скорость падает в разы.
- Apple Silicon (чипы M) - козырь: память общая, поэтому Mac на 32-64 ГБ делает то, на что ПК нужна дорогая карта.
- Квантизация - сжатие модели вчетверо почти без потери ума. Твой лучший друг на слабом железе.
- Слабая машина - не приговор: бери маленькую модель в сжатом виде и спокойно играйся локально.