Токены и цена ИИ: как не разориться на нейросети
Чат кажется бесплатным - ровно до первого счёта
Что такое токены, сколько стоит ИИ и как платить за нейросеть копейки: выбираем глубину ответа, считаем токены, ловим утечки бюджета и подбираем модель под задачу.
Что такое токены простыми словами
Представь такси, где платят не за поездку, а за каждое слово - и твоё, и водителя. Молчишь всю дорогу? Почти даром. Бросил «налево у магазина» - три копейки. Попросил рассказать всю его биографию - доставай кошелёк побольше.
ИИ работает ровно так же. Ты платишь не «за вопрос». Ты платишь за объём текста: за то, что отправил агенту, и за то, что он выдал в ответ. Этот текст режется на крошечные кусочки - токены Токен - кусочек текста, примерно 3-4 символа или три четверти слова. Модель и читает, и пишет токенами. Платишь и за входные (что ты дал), и за выходные (что она сгенерила) токены. . Больше текста - больше токенов. Больше токенов - больше денег и дольше ждать. Вот и вся арифметика.
Зачем вайбкодеру понимать стоимость ИИ
Ты вайбкодер. Чат поначалу кажется бесплатным. Почти. А потом прилетает счёт - и ты сидишь, чешешь затылок: откуда столько? Стоит разобраться с токенами, и картина меняется. Ты:
- перестаёшь платить за воздух - длинные ответы там, где хватило бы двух строк;
- видишь, куда утекают деньги, и затыкаешь дырки;
- успеваешь сделать втрое больше за те же деньги;
- не вздрагиваешь от счёта в конце месяца, потому что сам им рулишь.
Между «ИИ сожрал весь бюджет за неделю» и «мне хватает надолго» - всего три привычки: выбирать глубину ответа, следить за тратами и не звать дорогую модель на ерунду. Дальше по порядку.
Как считается стоимость токенов
Сколько токенов в обычном тексте
Текст для модели режется на токены. Запомни одну прикидку - её хватит в девяти случаях из десяти:
И вот тут засада. Ты платишь дважды. За вход - всё, что дал агенту: вопрос, файлы, историю переписки. И за выход - весь его ответ. Причём выход обычно дороже входа. Так что гигантская простыня в ответ бьёт по кошельку сильнее, чем длинный вопрос. Запомни это - пригодится.
Сколько стоят разные модели ИИ
Не все ИИ стоят одинаково. Есть эконом, есть бизнес-класс. Вот реальные цены за миллион токенов (данные из материалов ECC, 2025-2026):
| Модель | Вход (за 1 млн токенов) | Выход (за 1 млн токенов) | Во сколько раз дороже |
|---|---|---|---|
| Haiku 4.5 | 0,80 $ | 4,00 $ | 1x (самая дешёвая) |
| Sonnet 4.6 | 3,00 $ | 15,00 $ | ~4x |
| Opus 4.5 | 15,00 $ | 75,00 $ | ~19x |
Как платить за ИИ меньше: три приёма
Приём 1. Выбирай глубину ответа
Чаще всего ответ на три экрана тебе не нужен. Нужна суть. А агент по умолчанию старается быть обстоятельным - и палит токены на выход.
Хитрость простая: скажи заранее, какой длины ответ хочешь. Это и есть идея скилла token-budget-advisor - выбрать глубину до того, как агент начал писать. Секунда на старте, экономия на финише.
- Быстрая проверка факта или «да/нет» - хватит двух строк.
- Ты уже в теме, нужна только команда или решение, без лекции.
- Делаешь много мелких правок подряд - каждая простыня множится на счёт.
- Разбираешь новую тему с нуля - тут примеры и контекст экономят твоё время.
- Просишь план или архитектуру, где важны альтернативы.
- Это обучающий разбор, который перечитаешь не раз.
Грубая шкала глубины, которой пользуются опытные вайбкодеры:
- Коротко - прямой ответ, без вступлений. 2-4 предложения.
- Средне - ответ плюс немного контекста и один пример.
- Подробно - полный ответ с альтернативами и нюансами.
Дальше в этом чате отвечай в режиме «коротко»: только суть, 2-4 предложения, без вступлений и без воды. Если задача реально сложная и короткого ответа мало - сначала скажи мне об этом одной строкой и спроси, нужна ли подробная версия. Разворачивай подробно только когда я попрошу.
Приём 2. Следи за расходами на ИИ
Нельзя экономить то, чего не видишь. Скилл cost-tracking про одно: завести счётчик и регулярно в него заглядывать. Без счётчика ты едешь с закрытыми глазами.
Что полезно видеть:
- сколько ушло сегодня и сколько было вчера;
- общая сумма за всё время;
- в каком проекте утекает больше всего;
- какой инструмент или действие самое дорогое;
- сколько в среднем стоит одна сессия.
Приём 3. Подбирай модель под задачу
Это сердце скилла cost-aware-llm-pipeline. Идея в одном: не возить хлеб на вертолёте. Простую задачу отдай дешёвой модели, сложную - дорогой. Всё.
Грубое правило из материалов ECC. Текста мало, задача рутинная - берём дешёвую модель (Haiku). Текста много или задача сложная - много частей, анализ, архитектура - тогда уже дорогую (Sonnet или Opus). На простой работе дешёвая модель часто выходит в 3-4 раза дешевле при том же результате. Цифры приятные, согласись.
- Рутину (переименовать, причесать текст, мелкая правка) - на дешёвую модель.
- Сложное (архитектура, хитрый баг, большой разбор) - на дорогую, и только его.
- Длинную неизменную инструкцию кэшируешь, чтобы не платить за неё каждый раз заново.
- Ставишь лимит бюджета заранее - и тормозишь до того, как прилетит сюрприз.
- Гонишь всё подряд на самой дорогой модели «чтоб наверняка».
- Вываливаешь весь проект в каждое сообщение вместо нужного куска.
- Повторяешь одну и ту же длинную вводную в каждом запросе.
- Не ставишь лимит - узнаёшь сумму, только когда уже поздно.
Как сливается бюджет: разбор на примере
Ты делаешь сайт-визитку. Открыл чат и с порога вставил весь проект - 30 файлов, «чтобы агент был в курсе». Теперь каждое сообщение тащит за собой всю эту простыню. Дальше - больше: просишь подробные объяснения на каждый чих, гоняешь самую мощную модель, третий день сидишь в одном бесконечном чате. В конце недели открываешь счёт - и тихо грустишь.
Что произошло на самом деле:
- Ты платил за 30 файлов в каждом сообщении - а агенту нужны были один-два.
- Ты заказывал простыни на выход, хотя хватило бы абзаца.
- Ты держал дорогую модель на задачах, где справилась бы дешёвая.
- Ты не смотрел в счётчик и проспал момент, когда траты разогнались.
А теперь как сделал бы вайбкодер, который понимает, за что платит:
Помоги собрать сайт-визитку. Правила работы, чтобы не жечь лишнее:
- Не держи весь проект в контексте. Понадобится файл - попроси у меня конкретный, а не всё подряд.
- Отвечай коротко по умолчанию: суть и нужный код. Длинные объяснения - только если я прошу.
- Простые правки делай в экономном режиме, дорогую модель предлагай только для реально сложных задач и спрашивай меня заранее.
- В конце каждого блока работы напомни мне свериться с расходами за сегодня.
Частые ошибки новичка в работе с ИИ
- Вываливать весь проект в каждое сообщение. Платишь за это снова и снова. Давай нужный кусок.
- Заказывать простыни на выход. Выходные токены дороже входных. Проси нужную глубину.
- Гонять всё на самой дорогой модели. Рутину отдай дешёвой - она в разы экономнее.
- Сидеть в одном бесконечном чате. История растёт, и ты платишь за неё в каждом запросе. Чисти на границах задач.
- Повторять одну и ту же длинную вводную. Кэшируй её один раз.
- Не смотреть в счётчик. Без учёта траты разгоняются незаметно - пока не станет больно.
TL;DR - если коротко
- Токен - кусочек текста, примерно 3-4 символа. Платишь и за то, что дал ИИ, и за то, что он ответил.
- Грубо: 1000 токенов ≈ 750 слов ≈ полторы страницы. Большой файл = десятки тысяч токенов = живые деньги.
- Заранее проси нужную глубину: коротко, средне, подробно. Зачем платить за простыню, когда хватит абзаца?
- Хочешь видеть расходы на ИИ - веди учёт: сколько ушло сегодня, в каком проекте, на какой инструмент.
- Не зови дорогую модель на ерунду. Дешёвая модель делает рутину в разы дешевле, и часто с тем же результатом.
- Главная утечка бюджета - вывалить весь проект в чат и гнать бесконечный разговор без чистки.