~8 мин

Железо для локального ИИ: сколько VRAM реально нужно

Где живёт модель, сколько памяти ей подавай и что делать, когда её мало

Какое железо тянет локальные ИИ-модели: главный фактор - видеопамять VRAM, оперативка про запас, Apple Silicon с общей памятью. Прикидка под 7B, 13B и 70B плюс спасение для слабой машины.

Что такое VRAM и почему она решает всё

Локальная модель - это здоровенный файл с «мозгами». Чтобы он начал думать, его надо целиком поднять в быструю память. Вот и весь фокус.

Представь, что ты нанял повара. Он готовит быстро только тогда, когда все ингредиенты лежат у него на столе под рукой. Стол - это память видеокарты. А если половина продуктов в кладовке на другом этаже? Каждое блюдо превращается в марафон туда-обратно. Готовка встаёт.

Так вот, главный стол для ИИ - это видеокарта и её собственная память, VRAM. Не процессор. Не количество ядер. Не частота. А именно сколько гигабайт влезает в видеокарту. Правило номер один. Запомни его - и половина вопросов про железо отпадёт сама собой.

Повар-робот за столом: на столе помещаются все ингредиенты - готовит быстро, лишнее в далёкой кладовке - бегает и тормозит
VRAM - это стол повара. Всё влезло на стол - готовит быстро. Не влезло - бегает в кладовку (RAM) и тормозит.

Зачем разбираться в железе перед запуском модели

Чтобы не выкинуть деньги на ветер и не разочароваться раньше времени. История знакомая до боли: человек качает самую большую и умную модель, жмёт запуск - и компьютер либо виснет, либо выдаёт по слову в минуту. Отсюда вывод «локальный ИИ - это медленно и не работает». Вывод неверный. Просто модель не влезла на стол.

  • Поймёшь, какую модель твоя машина реально потянет, ещё до скачивания гигабайтов.
  • Перестанешь винить «слабый комп» там, где надо было просто взять модель поменьше.
  • Будешь выбирать осознанно: вот эту запущу мгновенно, а вон та не для моего железа.
  • Соберёшься докупать железо - посмотришь на правильную цифру (объём VRAM), а не на маркетинг.

Девять из десяти жалоб «локальная модель жутко тормозит» - это модель, которая не влезла в VRAM и наполовину свалилась в оперативку. Разберёшься с памятью - и проблема становится видимой и решаемой.

Три вида памяти для ИИ: VRAM, RAM и CPU

В компьютере есть несколько мест, где может «жить» модель. И по скорости они отличаются как гоночная трасса от просёлка.

VRAM - память видеокарты, главный стол

VRAM - та самая быстрая память прямо на видеокарте. Видеокарта умеет считать тысячи вещей разом, поэтому модели гоняют на ней, а не на процессоре. Но стол у неё не резиновый: бывает 8, 12, 16, 24 гигабайта. Сколько именно - решает почти всё.

RAM - обычная оперативка, запасная скамейка

Оперативка тоже работает - но для таких задач заметно медленнее. Не влезла модель в VRAM? Программа сбрасывает «лишний хвост» в оперативку - это называется офлоад (выгрузка). Модель запустится. Только скорость просядет в разы: видеокарте придётся то и дело бегать в кладовку за каждым кусочком.

Процессор (CPU) - крайний случай

Гонять модель можно и вовсе без видеокарты, на одном процессоре с оперативкой. Заработает. Но медленно - годится разве что пощупать совсем крохотную модель. Это план «Б», а не основная дорога.

Сколько VRAM нужно для 7B, 13B и 70B

Размер модели меряют в миллиардах параметров - это и есть буква B в названиях вроде 7B, 13B, 70B (B - billion, миллиард). Грубо: чем больше параметров, тем умнее модель и тем больше памяти ей подавай.

Вот прикидка для сжатого (квантизованного) вида - именно так модели обычно и запускают локально. Цифры ориентировочные, плюс-минус, без претензии на аптекарскую точность: реальный аппетит зависит ещё и от длины контекста (сколько текста модель держит в голове за раз).

Грубая прикидка VRAM под модель в сжатом 4-битном виде

7B / 8B (маленькая, шустрая) - примерно 5-6 ГБ VRAM. Заходит даже на скромную видеокарту на 8 ГБ. 13B (средняя, поумнее) - примерно 8-10 ГБ. Комфортно на карте 12-16 ГБ. 70B (большая, реально умная) - примерно от 40 ГБ. Это уже профессиональная карта, две видеокарты или Mac с большой памятью.

Три коробки разного размера 7B, 13B и 70B рядом со шкалой объёма VRAM
Чем больше модель - тем больше места на столе ей нужно. 70B уже не для обычной игровой видеокарты.

Apple Silicon и общая память: почему Mac тут в плюсе

У тебя Mac на чипе серии M (M1, M2, M3, M4 и дальше)? Тогда история другая - и во многом удачная для ИИ. У этих чипов общая память: процессор и встроенная графика делят один общий пул, а не дерутся за отдельные кусочки.

Apple Silicon с общей памятью означает вот что: сколько у тебя оперативки в Mac - почти столько же доступно и модели. Mac на 32-64 ГБ крутит то, под что на обычном ПК пришлось бы выложить кругленькую сумму за видеокарту с большим объёмом VRAM.

Плюсы Mac для локального ИИ
  • Общая память: графике доступно много, без отдельной видеокарты.
  • Тихо, холодно, экономно по энергии - можно крутить модель прямо на ноутбуке.
  • Mac на 32-64 ГБ тянет крупные модели, недоступные средней игровой видеокарте.
О чём помнить
  • Память впаяна намертво: сколько взял при покупке - столько и будет, доставить нельзя.
  • Чистая скорость на тяжёлых моделях обычно ниже, чем у топовой игровой видеокарты, зато памяти больше.
  • При выборе Mac под ИИ главное - брать побольше памяти, а не топовый процессор.

Как запустить локальный ИИ на слабом компьютере

Старый ноут, встроенная графика, видеокарта на 4-6 ГБ? Не повод опускать руки. Локальный ИИ - это не «топовое железо или никак». Есть два рычага, которые вытаскивают почти всех.

Рычаг 1. Бери модель поменьше

Самое очевидное и самое работающее. Маленькая модель (вроде 7B/8B, а есть и совсем крохи на 1-3B) влезет почти куда угодно. Да, она глупее большой. Но для кучи задач - суммаризация, простые вопросы, черновики, помощь по коду - её хватает с головой. Лучше шустрая маленькая модель, чем огромная, которая еле дышит или вообще не стартует.

Рычаг 2. Квантизация - сжатие модели

Квантизация - это когда числа внутри модели хранят менее точно, погрубее. Звучит пугающе, а на деле почти волшебство: модель занимает в памяти примерно вчетверо меньше, а отвечает почти так же хорошо. Вот почему 7B-модель влезает не в 14-16 ГБ, а в скромные 5-6 ГБ.

И приятное: руками ничего сжимать не надо. В готовых программах для запуска локальных моделей сжатые версии уже лежат на выбор - бери ту, что помечена как 4-битная (часто в названии торчит что-то вроде Q4), и всё.

Большая модель сжимается в маленькую коробку - метафора квантизации, экономящей память
Квантизация ужимает модель примерно вчетверо: ум почти тот же, а на стол она теперь влезает.

Частые ошибки новичка при выборе железа

  • Гнаться за самой большой моделью. 70B на видеокарте с 8 ГБ нормально не запустится. Соизмеряй размер модели со своей памятью.
  • Смотреть на процессор вместо видеокарты. Для ИИ решает VRAM, а не количество ядер CPU. Крутой процессор без хорошей видеокарты модель не спасёт.
  • Брать модель впритык под объём VRAM. Забыл про контекст - и в живом диалоге память кончилась. Всегда оставляй запас.
  • Качать несжатую модель «чтобы получше». На слабой машине это прямой путь к зависанию. Бери квантизованную версию - разница в качестве для новичка почти незаметна.
  • Думать, что без дорогой видеокарты ничего не выйдет. Маленькая сжатая модель работает даже на скромном железе и на Mac с общей памятью.
  • Винить «тормозной комп». Чаще всего тормозит не комп, а слишком большая модель, свалившаяся из VRAM в оперативку.

TL;DR - если коротко

  • Главный герой - видеокарта и её память VRAM. Влезла модель целиком - летает. Не влезла - ползёт.
  • Прикидка в сжатом 4-битном виде: 7B/8B - 5-6 ГБ, 13B - 8-10 ГБ, 70B - от 40 ГБ.
  • Оперативка (RAM) - запасная скамейка. Хвост модели можно сбросить туда, но скорость падает в разы.
  • Apple Silicon (чипы M) - козырь: память общая, поэтому Mac на 32-64 ГБ делает то, на что ПК нужна дорогая карта.
  • Квантизация - сжатие модели вчетверо почти без потери ума. Твой лучший друг на слабом железе.
  • Слабая машина - не приговор: бери маленькую модель в сжатом виде и спокойно играйся локально.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.