Токены и контекстное окно простыми словами
Почему модель теряет нить в длинном чате - и за что именно с тебя берут деньги
Что такое токены и контекстное окно нейросети простыми словами: почему модель забывает начало диалога, почему русский текст дороже английского и как платят за вход и выход.
Что такое токены и контекстное окно - на пальцах
Кажется, что модель читает текст как ты: слово за словом, по порядку. А вот и нет. Сначала она кромсает твой текст на мелкие кусочки - и эти кусочки называются токены Токен (token) - кусочек текста, которым оперирует модель. Это не всегда целое слово: часто часть слова, иногда символ или знак препинания. Модель видит текст как поток токенов, а не как буквы. .
Сравни с едой. Ты не глотаешь кусок целиком - откусываешь по чуть-чуть. Модель так же. Длинное слово превращается в два-три «откуса», короткое - в один. Вот эти кусочки она и «жуёт» вместо букв.
Теперь второе. Есть контекстное окно Контекстное окно (context window) - максимальное число токенов, которое модель удерживает за раз: твой запрос, история переписки и её ответ. Всё, что не влезло, она не видит. - её рабочая память. Это всё, что она видит прямо сейчас: твой вопрос, вся прошлая переписка и место под её ответ. У этого «стола» есть край. Всё, что не влезло, остаётся за ним.
Зачем новичку вообще знать про токены
Это не теория для галочки. От токенов и окна зависят три вещи, на которые ты наткнёшься в первый же рабочий день.
- Почему модель «тупит» в длинном чате. Переписка разрослась, начало уехало за край окна - и она правда забыла, с чего вы начинали.
- Почему растёт счёт. Платишь ты не за сообщения, а за токены. Гонишь в модель огромные простыни текста - платишь больше. Всё просто.
- Почему русский «дороже» английского. Один и тот же смысл по-русски занимает больше токенов, чем по-английски. То есть буквально дороже за тот же текст.
Девять из десяти жалоб в духе «модель меня не слушает, повторяется, забыла, что я просил» в длинном чате - это не баг и не характер. Это переполненное окно: старое уже выпало за край.
Как токены и окно работают на самом деле
Токен - это кусочек текста, а не слово
Буквы напрямую модель читать не умеет. У неё заранее готов словарь кусочков, и любой текст она раскладывает на них. Частое короткое слово нередко идёт одним токеном. Длинное или редкое - рубится на несколько частей.
Держи грубые ориентиры, чтобы прикидывать на глаз. Это примерно, а не точная формула:
- в английском один токен - это примерно 4 символа или около 3/4 слова;
- знаки препинания и пробелы тоже идут в счёт;
- по-русски на тот же смысл уходит заметно больше токенов: модели учат в основном на английском, а русский они режут мельче.
Контекстное окно - это стол, у которого есть край
Окно - это сколько токенов влезает на «рабочий стол» модели за один заход. Что лежит на столе одновременно:
- твой текущий вопрос;
- вся история переписки - или сколько от неё уместилось;
- системная инструкция, если она есть;
- и место под будущий ответ модели.
Стол забит, а ты дописываешь новое - и самое старое сваливается с края. Модель не «решает забыть». Она просто физически этого больше не видит. Вот почему в очень длинных чатах начало растворяется само собой.
Сколько стоят токены: вход и выход
Главное про деньги: платишь ты за токены, и считают их в двух корзинах.
- Вход (input) - всё, что ты отправил модели: твой запрос плюс история, которую ей пришлось перечитать.
- Выход (output) - всё, что модель написала в ответ.
И вот тут сюрприз для новичков: выходные токены обычно дороже входных - порой в несколько раз. Поэтому длинный ответ бьёт по кошельку сильнее, чем длинный вопрос.
- Можно скормить целый документ или длинный код за раз - модель видит всё разом.
- Меньше возни: не нужно резать задачу на куски и потом вручную склеивать ответы.
- В долгом разговоре модель дольше помнит, о чём вы говорили вначале.
- Каждый токен в окне - это деньги: набил окно под завязку - платишь по полной за каждый запрос.
- Чем плотнее набито окно, тем медленнее обычно идёт ответ.
- Модель может теряться в гигантской простыне и хуже находить нужное в середине.
Пример из жизни: почему чат «глупеет» к вечеру
Допустим, ты весь день сидишь с моделью в одном огромном чате: накидал туда ТЗ, кусок кода, обсуждение, правки, снова код. К вечеру вылезают две неприятности. Первая - модель будто «глупеет» и забывает то, что вы решили утром. Вторая - каждый ответ дорожает, хотя вопросы вроде те же. Причина одна: окно набито до краёв и перечитывается целиком на каждом шаге.
А что делают с этим на практике?
- Не тащи всю историю мира в один чат. Закрыл тему - открой новый чистый чат: окно снова пустое и дешёвое.
- Не вставляй гигантские простыни «на всякий случай». Дай модели ровно тот кусок, что реально нужен для задачи.
- Разговор разросся - попроси модель кратко суммировать договорённости, скопируй итог, открой новый чат и вставь только этот итог.
- Помни: длинный ответ дороже длинного вопроса. Просишь «покороче» - экономишь именно на дорогих выходных токенах.
- Пишешь по-русски и важна экономия - тот же запрос по-английски обычно займёт меньше токенов.
Частые ошибки новичка с контекстом
- Думать, что модель «помнит всё». Она помнит лишь то, что влезло в окно прямо сейчас. Старое из длинного чата для неё уже растворилось.
- Считать, что один токен - это одно слово. Не-а. Это кусочек, часто часть слова. А на русском их уходит заметно больше.
- Вставлять всё подряд «чтобы наверняка». Лишний текст - это лишние токены, то есть лишние деньги и тормоза. Пользы ноль.
- Забывать, что выход дороже входа. Огромный ответ бьёт по счёту сильнее огромного вопроса. Проси по делу.
- Месяцами жить в одном чате. Окно переполняется, модель «глупеет», а ты переплачиваешь за перечитывание истории. Заводи новый чат под новую тему.
TL;DR - если коротко
- Токен - это кусочек текста, чаще всего часть слова. Модель видит не буквы, а поток токенов.
- Прикидка: в английском один токен - это примерно 4 символа или около 3/4 слова. По-русски на тот же текст токенов уходит ощутимо больше.
- Контекстное окно - это всё, что модель держит перед глазами разом: твой вопрос, история чата и её будущий ответ.
- Вылетело за край окна - модель это забыла. Не вредность и не глюк: за границей окна для неё просто пусто.
- Платишь ты за токены: отдельно за вход (что прислал) и за выход (что написала). Выход обычно дороже.
- Большой контекст удобен, но каждый лишний токен - это деньги и капля тормозов. Рулить им учим в курсе вайбкодинга.