~8 мин

Токены и контекстное окно простыми словами

Почему модель теряет нить в длинном чате - и за что именно с тебя берут деньги

Что такое токены и контекстное окно нейросети простыми словами: почему модель забывает начало диалога, почему русский текст дороже английского и как платят за вход и выход.

Что такое токены и контекстное окно - на пальцах

Кажется, что модель читает текст как ты: слово за словом, по порядку. А вот и нет. Сначала она кромсает твой текст на мелкие кусочки - и эти кусочки называются токены .

Сравни с едой. Ты не глотаешь кусок целиком - откусываешь по чуть-чуть. Модель так же. Длинное слово превращается в два-три «откуса», короткое - в один. Вот эти кусочки она и «жуёт» вместо букв.

Теперь второе. Есть контекстное окно - её рабочая память. Это всё, что она видит прямо сейчас: твой вопрос, вся прошлая переписка и место под её ответ. У этого «стола» есть край. Всё, что не влезло, остаётся за ним.

Длинное слово разрезается на несколько кусочков-токенов, которые едут на ленте
Модель видит не буквы и не слова, а кусочки - токены.

Зачем новичку вообще знать про токены

Это не теория для галочки. От токенов и окна зависят три вещи, на которые ты наткнёшься в первый же рабочий день.

  • Почему модель «тупит» в длинном чате. Переписка разрослась, начало уехало за край окна - и она правда забыла, с чего вы начинали.
  • Почему растёт счёт. Платишь ты не за сообщения, а за токены. Гонишь в модель огромные простыни текста - платишь больше. Всё просто.
  • Почему русский «дороже» английского. Один и тот же смысл по-русски занимает больше токенов, чем по-английски. То есть буквально дороже за тот же текст.

Девять из десяти жалоб в духе «модель меня не слушает, повторяется, забыла, что я просил» в длинном чате - это не баг и не характер. Это переполненное окно: старое уже выпало за край.

Как токены и окно работают на самом деле

Токен - это кусочек текста, а не слово

Буквы напрямую модель читать не умеет. У неё заранее готов словарь кусочков, и любой текст она раскладывает на них. Частое короткое слово нередко идёт одним токеном. Длинное или редкое - рубится на несколько частей.

Держи грубые ориентиры, чтобы прикидывать на глаз. Это примерно, а не точная формула:

  • в английском один токен - это примерно 4 символа или около 3/4 слова;
  • знаки препинания и пробелы тоже идут в счёт;
  • по-русски на тот же смысл уходит заметно больше токенов: модели учат в основном на английском, а русский они режут мельче.

Контекстное окно - это стол, у которого есть край

Окно - это сколько токенов влезает на «рабочий стол» модели за один заход. Что лежит на столе одновременно:

  • твой текущий вопрос;
  • вся история переписки - или сколько от неё уместилось;
  • системная инструкция, если она есть;
  • и место под будущий ответ модели.

Стол забит, а ты дописываешь новое - и самое старое сваливается с края. Модель не «решает забыть». Она просто физически этого больше не видит. Вот почему в очень длинных чатах начало растворяется само собой.

Стол с краем, на нём стопки токенов, лишние падают за край
Контекстное окно - это стол. Влезло - видит, упало за край - забыла.

Сколько стоят токены: вход и выход

Главное про деньги: платишь ты за токены, и считают их в двух корзинах.

  • Вход (input) - всё, что ты отправил модели: твой запрос плюс история, которую ей пришлось перечитать.
  • Выход (output) - всё, что модель написала в ответ.

И вот тут сюрприз для новичков: выходные токены обычно дороже входных - порой в несколько раз. Поэтому длинный ответ бьёт по кошельку сильнее, чем длинный вопрос.

Чем хорош большой контекст
  • Можно скормить целый документ или длинный код за раз - модель видит всё разом.
  • Меньше возни: не нужно резать задачу на куски и потом вручную склеивать ответы.
  • В долгом разговоре модель дольше помнит, о чём вы говорили вначале.
Чем большой контекст кусается
  • Каждый токен в окне - это деньги: набил окно под завязку - платишь по полной за каждый запрос.
  • Чем плотнее набито окно, тем медленнее обычно идёт ответ.
  • Модель может теряться в гигантской простыне и хуже находить нужное в середине.
Весы или корзины с токенами: слева вход дешевле, справа выход дороже, Sodi объясняет
Платишь за токены на входе и выходе. Выход обычно дороже.

Пример из жизни: почему чат «глупеет» к вечеру

Допустим, ты весь день сидишь с моделью в одном огромном чате: накидал туда ТЗ, кусок кода, обсуждение, правки, снова код. К вечеру вылезают две неприятности. Первая - модель будто «глупеет» и забывает то, что вы решили утром. Вторая - каждый ответ дорожает, хотя вопросы вроде те же. Причина одна: окно набито до краёв и перечитывается целиком на каждом шаге.

А что делают с этим на практике?

Как держать контекст и счёт под контролем
  1. Не тащи всю историю мира в один чат. Закрыл тему - открой новый чистый чат: окно снова пустое и дешёвое.
  2. Не вставляй гигантские простыни «на всякий случай». Дай модели ровно тот кусок, что реально нужен для задачи.
  3. Разговор разросся - попроси модель кратко суммировать договорённости, скопируй итог, открой новый чат и вставь только этот итог.
  4. Помни: длинный ответ дороже длинного вопроса. Просишь «покороче» - экономишь именно на дорогих выходных токенах.
  5. Пишешь по-русски и важна экономия - тот же запрос по-английски обычно займёт меньше токенов.
Рюкзак с ограниченным местом: укладываются только нужные токены, рядом новый чистый чат и раздувшийся старый, Sodi помогает
Относись к контексту как к рюкзаку: клади только нужное.

Частые ошибки новичка с контекстом

  • Думать, что модель «помнит всё». Она помнит лишь то, что влезло в окно прямо сейчас. Старое из длинного чата для неё уже растворилось.
  • Считать, что один токен - это одно слово. Не-а. Это кусочек, часто часть слова. А на русском их уходит заметно больше.
  • Вставлять всё подряд «чтобы наверняка». Лишний текст - это лишние токены, то есть лишние деньги и тормоза. Пользы ноль.
  • Забывать, что выход дороже входа. Огромный ответ бьёт по счёту сильнее огромного вопроса. Проси по делу.
  • Месяцами жить в одном чате. Окно переполняется, модель «глупеет», а ты переплачиваешь за перечитывание истории. Заводи новый чат под новую тему.

TL;DR - если коротко

  • Токен - это кусочек текста, чаще всего часть слова. Модель видит не буквы, а поток токенов.
  • Прикидка: в английском один токен - это примерно 4 символа или около 3/4 слова. По-русски на тот же текст токенов уходит ощутимо больше.
  • Контекстное окно - это всё, что модель держит перед глазами разом: твой вопрос, история чата и её будущий ответ.
  • Вылетело за край окна - модель это забыла. Не вредность и не глюк: за границей окна для неё просто пусто.
  • Платишь ты за токены: отдельно за вход (что прислал) и за выход (что написала). Выход обычно дороже.
  • Большой контекст удобен, но каждый лишний токен - это деньги и капля тормозов. Рулить им учим в курсе вайбкодинга.

Поиск по вики

Нажмите Esc для закрытия

Введите запрос для мгновенного поиска по всем страницам курсов и уроков.