Как выбрать модель ИИ под задачу: гид по reasoning, цене и контексту
Не зови экскаватор, чтобы вкрутить лампочку
Как выбрать модель ИИ под задачу: reasoning-модели для кода и логики, дешёвые для классификации, большой контекст для документов, локальные для приватных данных. Бери минимально достаточную.
Что значит «выбрать модель под задачу»
Представь, что в гараже у тебя весь автопарк: самокат, обычная легковушка, гоночный болид и бронированный фургон инкассатора. Ездят все. Но поедешь на болиде за хлебом в соседний двор - сожжёшь бак, оглушишь соседей и спустишь кучу денег ни на что. А холодильник на самокате? Просто не довезёшь.
С языковыми моделями LLM (большая языковая модель) - программа, обученная на огромном тексте, которая отвечает на запросы словами. ChatGPT, Claude, Gemini и локальные модели - это всё LLM. ровно та же история. Их много, они разной мощности и цены. И фокус не в том, чтобы найти «самую лучшую». Фокус - под конкретную задачу взять подходящую. Часто это не топ, а наоборот - самая скромная, которая справляется.
Зачем вообще выбирать модель под задачу
Можно лить все задачи в одну самую дорогую модель. И оно даже заработает. Только переплачивать будешь в разы, ждать дольше, а иногда ещё и получать результат хуже. Тяжёлая модель умеет «переумничать» на ерунде и закопаться там, где хватило бы одной строчки.
- Экономия. Между самой дешёвой и топовой - разница в цене в разы за те же объёмы. На потоке задач это превращается в серьёзные деньги.
- Скорость. Лёгкая модель отвечает заметно быстрее. Для мелочей, автоматизации и живого чата это решает всё.
- Приватность. Часть данных в облако просто нельзя отправлять. Вопрос тут не про цену - можно ли вообще.
- Качество. На сложной логике дешёвая модель сыпется. А вот понимать, когда поднять мощность, - это уже навык.
Девять из десяти жалоб «ИИ тупит» и «ИИ дорогой» - это не про ИИ. Это про то, что взяли не ту модель под задачу. Самокат не виноват, что не везёт холодильник.
Три весовые категории моделей: лёгкие, средние, тяжёлые
Начни с главного - с веса. По уму и цене модели грубо ложатся на три полки. Имена и версии тасуются постоянно, так что запоминай полки, а не названия.
Дешёвые и быстрые модели - для мелочей и потока
Самые лёгкие. Стоят копейки, отвечают почти мгновенно. В сложной логике не блещут - так от них этого и не требуется.
Бери их на: классификацию Классификация - задача разложить вход по заранее заданным ящикам: спам или не спам, позитив или негатив, категория товара. Для неё не нужна тяжёлая модель. (спам или не спам, тон отзыва), извлечение данных из текста, простую переформулировку, перевод коротких фраз, сортировку и маршрутизацию запросов. Всё, где думать глубоко не надо, а надо быстро и помногу.
Средние модели - рабочая лошадка на каждый день
Золотая середина по цене и уму. Это дефолт для большинства задач: написать письмо, собрать черновик статьи, объяснить тему, накидать несложный скрипт, ответить пользователю в чате.
Не знаешь, с чего стартовать? Стартуй отсюда. В девяти случаях из десяти средней хватает. А на дешёвую или топовую сместишься, только когда упрёшься в потолок - снизу (задача слишком простая, чтобы платить) или сверху (задача ей не по зубам).
Тяжёлые reasoning-модели - для сложного кода и логики
Топовые модели с режимом рассуждения Reasoning (рассуждение) - режим, в котором модель перед ответом «думает» пошагово: раскладывает задачу, проверяет варианты. Сильнее на сложной логике, коде и математике, но дороже и медленнее. . Дорогие и не самые шустрые, зато на сложной логике им нет равных.
Доставай их под запутанный код и отладку, многошаговую логику, серьёзную математику, архитектурные решения, длинные цепочки выводов - там, где одна ошибка ломает всё. Экономить тут себе дороже: дешёвая модель выдаст правдоподобную чушь, и на проверку уйдёт больше, чем ты сэкономил.
Контекстное окно и приватность: две отдельные оси выбора
Вес - не всё, что ты выбираешь. Поверх него есть ещё две независимые штуки. Они не про «умнее или глупее», а про «влезет ли документ» и «можно ли вообще выпускать данные наружу».
Большое контекстное окно - для длинных документов
Размер контекстного окна Контекстное окно - сколько текста модель удерживает «в голове» за один запрос: и твой ввод, и её ответ. Измеряется в токенах. Чем больше окно, тем длиннее документ влезает целиком. - отдельная ось, и она часто идёт в комплекте с топовыми моделями. Надо скормить целый договор, всю кодовую базу или книгу? Нужна модель, которая удержит это целиком, а не по кусочкам.
Топовые модели сегодня держат огромные окна: счёт идёт на сотни тысяч токенов Токен - кусочек текста, которым оперирует модель. Грубо: один токен это примерно три-четыре символа, или около трёх четвертей слова. Длину документа и цену считают в токенах. , а у части моделей - и больше. Точные цифры устаревают на глазах, но принцип железный: длинный документ - модель с большим окном. Иначе она «забудет» начало к тому моменту, как доберётся до конца.
Локальные модели - для приватных данных
Особый случай. Локальная модель Локальная модель - модель, которая запускается на твоём компьютере или сервере, без отправки данных в чужое облако. Обычно слабее топовых облачных, зато данные не покидают твоё железо. крутится на твоём железе и никуда не отправляет данные. Слабее облачных топов - обычно да. Зато тут критерий выбора совсем другой.
Бери локально, когда данные нельзя выпускать наружу: медицинские карты, юридические документы клиентов, чужие коммерческие секреты, персональные данные под защитой закона. Вопрос не «дешевле или дороже», а «можно ли это вообще отправлять в облако». Часто - нельзя.
Главный принцип: бери минимально достаточную модель
Вот правило, на котором держится всё. Не бери модель мощнее, чем нужно задаче. Начинай снизу и поднимайся - только если результат реально плохой.
- Стартуешь с дешёвой или средней - получаешь результат за копейки и почти мгновенно.
- Поднимаешь мощность точечно, только там, где реально упёрся в потолок.
- Платишь за ум ровно там, где ум нужен, - и нигде больше.
- Льёшь всё в топовую - и переплачиваешь в разы за классификацию и мелочи.
- Ждёшь медленный ответ там, где за глаза хватило бы быстрого.
- Иногда получаешь хуже: тяжёлая модель «переумничает» на простом.
Классификация, спам, тон отзыва, извлечение полей - дешёвая быстрая.
Письмо, статья, объяснение, несложный скрипт, чат-ответ - средняя рабочая.
Сложный код, отладка, многошаговая логика, математика - тяжёлая reasoning.
Договор целиком, вся кодовая база, книга - модель с большим окном.
Мед, юр, чужие секреты, персональные данные - локальная на своём железе.
Не знаешь, с чего начать, - бери среднюю и двигайся от неё.
Пример: один проект, четыре разные модели
Допустим, ты делаешь приложение для отзывов о кафе. В одном проекте спокойно уживаются разные модели - каждая на своём месте. И это норма, а не зоопарк.
- Раскидать входящие отзывы на «хороший» и «плохой» - это классификация, бери самую дешёвую и быструю.
- Сгенерировать вежливый ответ на отзыв - средняя рабочая модель, ей такое по плечу.
- Написать модуль аналитики с хитрой логикой подсчёта - тут уже тяжёлая reasoning-модель.
- Разобрать договор аренды на двести страниц целиком - модель с большим контекстным окном.
- Если во входящих всплывают персональные данные клиентов, которые нельзя слать в облако, - локальная модель.
Частые ошибки при выборе модели
- Лить всё в самую дорогую модель. Классификация на топовой reasoning-модели - это поездка за хлебом на болиде. Едет, но переплата в разы.
- Экономить на сложной логике. Запутанный код на самой дешёвой модели даст правдоподобную чушь. На её проверку уйдёт больше, чем ты сэкономил.
- Резать длинный документ на куски без нужды. Есть модель с большим окном - дай документ целиком. Иначе она забудет начало к концу.
- Грузить гигантский контекст «на всякий случай». Дороже и хуже: середину длинного текста модели читают слабее. Грузи только то, что реально надо видеть целиком.
- Слать приватные данные в облако. Мед, юр, чужие секреты - это не про экономию, а про «можно ли вообще». Часто нельзя - тогда только локально.
- Заучивать конкретные имена моделей. Версии меняются постоянно. Держи в голове категории - и любая новинка сама встанет на свою полку.
TL;DR - если коротко
- Модели делятся по весу: дешёвые-быстрые, средние-рабочие, тяжёлые-думающие. Цена между крайними - в разы.
- Сложный код и логика - топовая reasoning-модель. Мелочи и классификация - самая дешёвая. На сложном не жмись, на мелочи не лей деньги.
- Длинные документы (договор, кодовая база, книга) - модель с большим контекстным окном. Не пять запросов подряд - один.
- Приватные данные (мед, юр, чужие секреты) - локальная модель на своём железе. Ничего не утечёт.
- Главный принцип: бери минимально достаточную. Начни снизу, поднимай мощность только когда реально упёрся.
- Имена и версии моделей тасуются каждый месяц. Держи в голове категории, а не названия.