Цена и скорость ИИ-моделей: дешёвая против дорогой
В одной семье моделей живут и спринтеры, и тяжеловесы - бери под задачу
Дешёвая или дорогая ИИ-модель - что выбрать? Разбираем оплату по токенам (вход и выход), почему ответ дороже вопроса и как раскидать задачи, чтобы счёт за API упал в разы.
Дешёвая модель против дорогой: в чём разница простыми словами
Представь службу доставки. Отвезти пиццу через два двора? Курьер на самокате: дёшево, быстро, доехал. А диван через весь город самокатом не повезёшь - тут нужен грузовик с грузчиками. Дороже, медленнее, зато тащит что угодно.
С семьёй ИИ-моделей всё ровно так же. Есть малыши: шустрые, дешёвые, отвечают почти мгновенно. Есть тяжеловесы: умнее, надёжнее в сложном, но дороже и слегка медленнее. И вот что важно - это не «плохая и хорошая» модель. Это самокат и грузовик. Под разный груз.
Зачем тебе вообще знать про цену моделей
В чате тебе обычно всё равно: нажал кнопку, получил ответ, лимит покрывает подписка. Но стоит подключить модель через API в своё приложение или скрипт - и за каждый чих платишь ты сам. Вот тут разница между уровнями превращается в живые деньги в конце месяца.
- Поймёшь, почему счёт раздувается на ровном месте - и где его подрезать.
- Перестанешь хватать самый дорогой уровень «на всякий случай» там, где хватило бы малыша.
- Привыкнешь спрашивать себя: «а это точно работа для грузовика?» - и сбережёшь кучу денег.
- Дойдёшь до автоматизаций - и сразу будешь проектировать дёшево, а не переделывать потом.
Классическая ошибка новичка - гонять флагман на задачах вроде «разложи письма по папкам» или «достань телефон из текста». Это как возить один конверт фурой. Едет. Но платишь за фуру.
За что ты платишь: токены, а не запросы
Усвой главное: ты платишь не за «запрос» и не за «минуту». Ты платишь за токены Токен (token) - кусочек текста, которым оперирует модель. Это не ровно буква и не ровно слово: грубо - 3-4 символа, или около трёх четвертей слова для английского; для русского обычно меньше слов на токен. Текст режется на токены и на входе, и на выходе. - мелкие кусочки текста.
И счёт собирается из двух частей:
- Вход (input) - всё, что ты отправил модели: вопрос, инструкция, приложенный документ, история переписки. Длиннее ввод - дороже счёт.
- Выход (output) - всё, что модель написала в ответ. Тоже идёт в счёт, и обычно по тарифу повыше.
Уровни моделей внутри одной семьи: малыш, середнячок, тяжеловес
У каждого крупного производителя линейка устроена ступеньками. Условно три полки: малыш, середнячок, тяжеловес. Вот два края этой лесенки.
- Отвечает почти мгновенно - находка там, где важна скорость.
- Стоит копейки за токен - можно гонять тысячи запросов подряд.
- Отлично тянет рутину: сортировку, извлечение данных, короткие ответы, модерацию.
- Спотыкается на длинных хитрых рассуждениях и многошаговых задачах.
- Крепче держит сложную логику, длинный контекст и тонкие нюансы.
- Стоит заметно дороже за те же токены - порой в разы.
- Медленнее: на каждый ответ уходит больше времени.
- Звать его на мелочь - переплата без всякой выгоды.
Посередине обычно стоит середнячок - универсал на каждый день: умнее малыша, дешевле тяжеловеса. Его-то чаще всего и советуют как «дефолт»: с него стартуешь, а в стороны двигаешься, только когда упрёшься в потолок.
Пример из жизни: как раскидать задачи по уровням моделей
Скажем, ты собираешь маленький сервис, который разбирает входящие письма. Не вали всё на одну модель - раскидай по уровням, как менеджер раздаёт задачи команде.
Малышу (дёшево, быстро):
- определить язык письма;
- понять, спам это или нет;
- вытащить из текста почту, телефон, дату;
- разложить письма по папкам (продажи, поддержка, прочее);
- сделать короткое резюме в одну строчку.
Тяжеловесу (дорого, но умнее):
- написать вдумчивый ответ клиенту с учётом всей переписки;
- разобрать запутанный юридический или технический абзац;
- спланировать многошаговое действие, где легко ошибиться;
- всё, где цена ошибки выше, чем цена токенов.
Логика проста: почти всё - это рутина, и её спокойно тянет дешёвый малыш. А дорогую модель ты бережёшь для тех редких случаев, где реально нужна голова. Результат тот же, а счёт падает в разы.
Как за минуту прикинуть стоимость запроса к ИИ
Хочешь, чтобы цифры стали осязаемыми? Прикинь стоимость на глаз ещё до запуска. Точные тарифы возьмёшь на сайте провайдера, а формула простая и не меняется годами.
- Прикинь длину входа в словах (вопрос плюс приложенные файлы и история).
- Умножь слова примерно на 1,3 - получишь грубое число входных токенов.
- Так же прикинь длину ожидаемого ответа - это выходные токены.
- Возьми с сайта цену за вход и цену за выход (их считают за тысячу токенов).
- Стоимость = вход в токенах × цена входа + выход в токенах × цена выхода.
- Умножь на число запросов в день - и увидишь, во что выльется месяц.
Один такой подсчёт на салфетке отрезвляет лучше любой статьи: сразу видно, что длинная история переписки или «напиши подробно» стоят ощутимо дороже короткого делового запроса.
Чем ещё можно срезать счёт за API
Кроме выбора уровня, есть пара рычагов, про которые полезно хотя бы знать (подробно - в уроках про оптимизацию):
- Кэширование одинакового входа. Шлёшь раз за разом один и тот же длинный кусок - например, инструкцию или базу? Его можно закэшировать, и повторные показы обойдутся сильно дешевле.
- Пакетная обработка. Когда ответ нужен не «прямо сейчас», а можно подождать, многие провайдеры считают такие задачи дешевле обычных.
- Не таскать лишнее в контексте. Каждый прикреплённый файл и вся история переписки - это входные токены, за которые платишь ты. Чисти то, что модели не нужно для текущего ответа.
Частые ошибки при выборе модели по цене
- Хватать флагман «на всякий случай». Самый дорогой уровень ради сортировки писем - это фура из-за одного конверта. Начни с малыша, подними планку, только если он не справится.
- Думать, что платишь за «запрос». Нет - платишь за токены, и за вход, и за выход. Длинный документ на входе или простыня на выходе тихо надувают счёт.
- Забывать про историю переписки. В длинном чате каждый новый вопрос тащит с собой весь прошлый разговор как вход. Оттого долгие диалоги дорожают сами собой.
- Заучивать конкретные цены. Они меняются постоянно. Держи в голове принцип «дёшево против дорого», а число смотри в прайсе перед запуском.
- Гнаться только за дешевизной. Если малыш выдаёт кашу и ты переделываешь по три раза - экономия мнимая. Иногда тяжеловес с первого раза выходит дешевле, чем малыш с пятого.
TL;DR - если коротко
- В одной семье моделей живут уровни: быстрые дешёвые малыши, медленные дорогие тяжеловесы и середнячок на каждый день между ними.
- Платишь не за «запрос», а за токены - кусочки текста. В счёт идёт и твой ввод, и ответ модели.
- Ответ дороже вопроса: модель лепит его по кусочку, и каждый кусочек капает в счёт.
- Главный рычаг: рутину - дешёвой модели, сложное - дорогой. Не пали из пушки по воробьям.
- Точных цифр тут нет нарочно: цены и названия моделей меняются каждый месяц. Запоминай принцип, тариф смотри у провайдера.
- Трюки вроде кэширования и пакетной обработки режут счёт ещё глубже - но это уже следующий уровень.