Ollama: как запустить локальную нейросеть одной командой
Установил, набрал run - и в твоём терминале уже сидит живой ИИ
Ollama - самый простой способ запустить локальную нейросеть: установка, команды pull и run, чат в терминале офлайн. Разбираем тихий сервер под капотом простыми словами.
Что такое Ollama простыми словами
Раньше запустить языковую модель на своём компе было как собрать мотоцикл из коробки деталей. Драйверы, библиотеки, веса модели, форматы с непонятными буквами в названии - и всё это красиво ломается на третьем шаге. Большинство просто сдавалось.
Ollama - это когда мотоцикл приехал уже собранным. Ты говоришь «привези модель» и «поехали», а всю грязную работу он берёт на себя. Скачать, распаковать, подогнать под твою память, договориться с видеокартой - молча, за кулисами, без твоего участия.
По сути это менеджер локальных моделей. Одной командой скачал, другой запустил - и вот ты уже переписываешься с ИИ прямо в чёрном окне терминала. Без облака. Без аккаунта. Твои данные никуда не улетают.
Зачем вайбкодеру локальный запуск моделей
Ты вайбкодер. Математика внутри модели тебе не сдалась - тебе надо быстро её запустить и пощупать. Ollama даёт ровно это, с минимумом боли.
- Бесплатно и без лимитов. Скачал модель - и гоняй сколько влезет. Никакого счётчика токенов, никакой ежемесячной подписки.
- Приватность. Всё крутится на твоём компе. Можно скармливать рабочие тексты и код, не вздрагивая от мысли, что они уедут на чужой сервер.
- Офлайн. Интернет нужен один раз - на скачивание. Дальше хоть в самолёте, хоть на даче без связи.
- Это фундамент. Почти все локальные инструменты и агенты из следующих уроков умеют цепляться к Ollama. Поставил один раз - считай, открыл себе половину курса.
Девять из десяти историй «хотел попробовать локальный ИИ, но забил» - это люди, утонувшие в настройке за первый час. Ollama придумали именно затем, чтобы этого часа не было.
Команды Ollama: pull, run, list
Вся логика держится на паре простых команд. Запомни их как глаголы: скачать, запустить, посмотреть. Всё.
Команда pull - скачать модель на диск
pull pull - команда Ollama, которая скачивает модель из общего каталога на твой диск. Нужен интернет. Делается один раз для каждой модели. говорит: «съезди в каталог и привези мне вот эту модель». Ollama качает файл и кладёт к себе. Операция разовая - один раз привёз, дальше модель просто лежит на диске и ждёт.
Модели в каталоге названы по-человечески: имя плюс размер. Чем модель больше, тем умнее - но тем больше места и памяти ей подавай. Начни с маленькой: она шустрее и точно влезет.
Команда run - запустить модель и открыть чат
run run - команда Ollama, которая загружает модель в память и сразу открывает чат прямо в терминале. Если модель ещё не скачана, run сам сделает pull. - это сердце всего. Грузит модель в память и сразу кидает тебя в чат прямо в терминале: появляется приглашение, ты пишешь сообщение, модель отвечает. Как переписка в мессенджере. Только собеседник живёт у тебя на компе, а не на чужом сервере.
И приятный бонус. Напишешь run на модель, которой ещё нет, - Ollama сам сначала её привезёт (сделает pull), а потом запустит. В самый первый раз можно вообще обойтись одной командой.
Команда list - посмотреть скачанные модели
list list - команда Ollama, которая показывает список уже скачанных моделей на твоём диске. показывает, что ты уже привёз. Удобно, когда забыл, что качал, или прикидываешь, сколько места модели сожрали.
ollama pull llama3
ollama run llama3
ollama list
Локальный сервер Ollama: что работает под капотом
Вот неочевидная, но важная штука. Когда Ollama запущен, он держит у тебя на машине маленький локальный сервер - тихую программу, которая работает в фоне и ждёт запросов.
Локальный сервер Локальный сервер - программа, которая постоянно работает в фоне на твоём компе и отвечает на запросы. «Локальный» значит, что он живёт у тебя, а не где-то в облаке. Ollama поднимает такой сервер, чтобы к модели можно было обращаться не только из терминала. - это как ресепшн в отеле. Терминал, в котором ты болтаешь, - всего лишь один гость, который подошёл и задал вопрос. Но к тому же ресепшну могут подойти и другие программы: редактор кода, твой собственный скрипт, плагин в браузере. Все стучатся к одному серверу и получают ответы от модели.
А ещё под капотом Ollama тихо делает квантизацию Квантизация - сжатие модели: числа внутри неё округляют, чтобы файл стал меньше, а памяти требовалось в разы меньше. Качество чуть падает, но модель влезает в обычный комп. Ollama делает это за тебя по умолчанию. - берёт сжатую версию модели, которая влезает в обычную память и не просит серверную видеокарту. Думать об этом тебе не надо, а знать полезно. Вот почему модель в несколько гигабайт спокойно стартует на твоём ноутбуке, а не только в дата-центре.
Как запустить Ollama: от нуля до чата за три шага
Самое приятное - действий тут реально мало. Поставил, привёз, запустил.
- Поставь Ollama под свою систему. Есть версии для Windows, macOS и Linux. Ставится как обычная программа, через мастер установки. После этого в фоне уже крутится локальный сервер.
- Привези небольшую модель. Открой терминал, набери pull с именем модели. Подожди, пока скачается, - это разовое дело, потом забудешь.
- Запусти её командой run с тем же именем. Выскочит приглашение для ввода - пиши вопрос, получай ответ прямо в терминале. Всё, ты разговариваешь с локальным ИИ.
Стоит ли вообще возиться с локальным запуском, когда есть облачные модели? Зависит от задачи.
- Нужна приватность - данные не должны уходить с компа.
- Хочешь гонять модель много и без счёта за токены.
- Часто работаешь офлайн или с дёрганым интернетом.
- Учишься и экспериментируешь - ошибиться не страшно, всё бесплатно.
- Слабое железо - большие модели будут тормозить или не влезут.
- Нужна топовая точность здесь и сейчас - облачные гиганты пока умнее.
- Лень разбираться даже с тремя командами - тогда начни с веб-чата.
Частые ошибки новичков с Ollama
- Качать сразу самую большую модель. Не влезет в память или будет отвечать по слову в минуту. Начни с маленькой, распробуй, потом расти.
- Путать pull и run. pull только привозит модель, чат не открывает. Болтать начинаешь после run. Хотя в крайнем случае run сделает оба шага сам.
- Думать, что нужен постоянный интернет. Не нужен. Интернет нужен один раз - на скачивание. Дальше всё офлайн.
- Закрывать терминал, чтобы выйти из чата. Лучше выйди аккуратно командой выхода - модель выгрузится из памяти, и комп не будет зря держать её в фоне.
- Ждать качества, как у топовой облачной модели. Локальная модель - это компромисс: приватность и бесплатность в обмен на чуть меньше ума. Для большинства задач этого за глаза.
- Не глянуть, хватает ли места на диске. Модели весят гигабайты. Перед pull проверь, есть ли куда их положить.
TL;DR - если коротко
- Ollama прячет всю боль запуска локальной модели за двумя командами. Поставил - и работаешь.
- pull качает модель на диск (интернет нужен один раз), run запускает и сразу кидает тебя в чат.
- Скачал - и можно офлайн: ни подписок, ни счётчика токенов, всё крутится на твоём железе.
- Под капотом тихо висит локальный сервер - к нему цепляются и другие программы, не только терминал.
- Модель идёт сжатой (квантизация), поэтому влезает в обычную память, а не просит дата-центр.
- Три глагола на первый день: pull, run, list. Серьёзно, больше пока не надо.