Что такое токены в нейросети: почему ответ обрывается и как уложиться в лимит
Нейросеть оборвала ответ на середине фразы. Через десять сообщений забыла, о чём вы просили в начале. А счёт за API вырос вдвое, хотя запросов было столько же. Все три истории про одно и то же - про токены. Разбираем, что это за единица, сколько её съедает русский текст, как посчитать свой документ до отправки и какими приёмами влезть в лимит, не потеряв качество ответа.

- Что такое токен и почему это не слово и не буква
- Сколько токенов съедает страница русского текста
- Почему нейросеть обрывает ответ и забывает начало разговора
- Как посчитать токены своего текста до отправки запроса
Что такое токен простыми словами
Токен - это кусочек текста, которым нейросеть меряет всё: и ваш запрос, и свой ответ. Чаще всего это не целое слово, а его часть.
Нейросеть не читает буквы и не читает слова. Перед работой она режет текст на короткие куски и подставляет каждому куску номер из своего внутреннего словаря. Эти куски и называются токенами. Дальше модель работает уже не с текстом, а с последовательностью чисел - и любые лимиты, счётчики и тарифы считают именно их.
Токеном может оказаться целое слово, часть слова, отдельная буква, знак препинания или пробел. Правило простое: чем чаще последовательность символов встречалась в обучающих текстах, тем выше шанс, что она уложится в один токен. Слово «кот» короткое и частое - это один токен. Слово «токенизация» длинное и редкое - три-четыре куска.
На практике это выглядит так. Фраза «Привет, как дела?» - не три слова, а примерно шесть-семь токенов: отдельно «Привет», отдельно запятая, отдельно «как», слово «дела» может разделиться на «дел» и «а», отдельно вопросительный знак. Пробелы обычно прилипают к соседнему куску и отдельными токенами не считаются. Точное деление у каждой модели своё: словари разные.
Зачем вообще резать текст на куски
Два очевидных варианта - считать буквами или считать словами - оба плохие. Буквами выходит слишком длинная последовательность: модель тратит огромные ресурсы, чтобы собрать из них смысл. Словами - слишком большой словарь: в русском одно слово живёт в десятке форм, плюс имена, термины, опечатки, и любое незнакомое слово модель просто не прочитает.
Токены - компромисс. Частые слова остаются целыми, редкие собираются из знакомых кусочков. Благодаря этому модель читает вообще любое слово, включая выдуманное: она разложит его на части, которые уже видела. Поэтому нейросеть спокойно работает с названием вашей компании, которого нет ни в одном словаре.
Практический вывод для обычного пользователя один: токен - это единица счёта, а не единица смысла. Когда сервис пишет «лимит 32 000 токенов», он не имеет в виду 32 000 слов. Реальный объём текста будет заметно меньше, и насколько именно - зависит от языка. Об этом следующие два раздела.
Сколько токенов в русском тексте: таблица ориентиров
Для английского один токен - это примерно 4 символа или 0,75 слова. Для русского - примерно 2-3 символа. Страница А4 в среднем весит 600-900 токенов.
Официальный ориентир от разработчиков звучит так: для английского языка один токен - это в среднем около четырёх символов или три четверти слова. То есть 1000 токенов - это примерно 750 английских слов. Для кириллицы цифра другая: один токен покрывает примерно два-три символа.
Из этой пропорции можно собрать бытовую шпаргалку. Она не даёт точное число - точное считается токенизатором конкретной модели, - но её достаточно, чтобы прикинуть, влезет ваш документ в лимит или нет.
| Что считаем | Примерно в токенах |
|---|---|
| Короткое частое слово (кот, дом, план) | 1 |
| Длинное или редкое слово (токенизация, кластеризация) | 3-4 |
| Предложение из 10 слов | 15-25 |
| Абзац на 500 знаков | 170-250 |
| Страница А4, около 1800 знаков с пробелами | 600-900 |
| Статья на 20 000 знаков | 7 000-10 000 |
| Книга на 300 страниц | 200 000-270 000 |
Считать удобно от знаков, а не от слов: возьмите объём текста в символах с пробелами (его показывает любой редактор) и разделите на 2,5. Получите рабочую оценку в токенах для русского текста. Для английского делите на 4.
Что ломает эту оценку
Оценка «делим на 2,5» перестаёт работать на нескольких типах текста, и это стоит держать в голове.
- Таблицы и выгрузки. Разделители, повторяющиеся заголовки колонок и служебные символы дают много коротких токенов. Таблица на 1800 знаков может весить в полтора раза больше обычного абзаца того же объёма.
- Код и логи. Скобки, отступы, переносы строк - каждый такой символ часто идёт отдельным токеном.
- Числа. Длинное число вроде 1 480 320 обычно рассыпается на несколько токенов, а не считается одним.
- Опечатки и редкие термины. Модель не узнаёт слово и собирает его из мелких кусков - расход растёт.
- Эмодзи и спецсимволы. Один значок нередко весит два-три токена.
И главная поправка: ответ модели тоже состоит из токенов и тоже попадает в лимит. Если вы отправили документ на 900 токенов и попросили пересказ на страницу, из окна уйдёт не 900, а порядка 1800.
Почему русский текст ест токенов больше английского
Одна и та же мысль, записанная по-русски и по-английски, стоит разного количества токенов. Разница в замерах обычно укладывается в диапазон от 1,4 до 2 раз не в пользу русского: типичный пример - короткая русская фраза на 38 символов разбивается на 13 токенов, её английский аналог - на 9. У причин этого три слоя.
Первый - кодировка. В UTF-8 латинская буква занимает один байт, кириллическая - два. Русская буква изначально «дороже» английской ещё до всякой токенизации.
Второй - морфология. В русском одно слово живёт в десятке форм: кот, кота, коту, котом, коте, коты, котов, котам. Каждая форма встречается в текстах реже, чем единая английская cat, поэтому реже попадает в словарь целым куском и чаще собирается из частей.
Третий - обучающие данные. Технология больших языковых моделей выросла на англоязычных корпусах, и словари токенизаторов исторически затачивались под английский. Русский там присутствует, но по остаточному принципу.
Российские модели считают русский экономнее
Это не universal-константа, а свойство конкретного словаря. Модели, которые целенаправленно обучали на русском, режут его заметно эффективнее. Яндекс приводил показательное сравнение: 32 000 токенов контекста в YandexGPT 5 Pro на русскоязычных текстах соответствуют примерно 48 000 токенов у модели Qwen-2.5-32B. То есть окно меньше по цифре, но помещается в него сопоставимый объём текста.
Отсюда неочевидный вывод, который редко проговаривают: сравнивать модели по размеру окна в токенах некорректно, если вы работаете на русском. Миллион токенов у модели с англоцентричным словарём и 128 тысяч у модели, обученной на русском, отличаются не в восемь раз, а меньше. Честное сравнение делается в знаках вашего реального текста, а не в токенах из маркетинговой таблицы.
Практический приём отсюда: если задача целиком на русском и объёмы большие, российские модели дают выигрыш не только по доступности оплаты, но и по расходу токенов. Если текст смешанный или технический, разница сглаживается.
Контекстное окно: почему нейросеть забывает начало разговора
Контекстное окно - это сколько токенов модель держит в голове за один раз. Туда входит и вся история чата, и ответ. Кончилось окно - старые сообщения выпадают.
У любой модели есть предел: сколько токенов она способна удерживать одновременно. Это и называется контекстным окном. Важная деталь, которую почти всегда упускают: в окно входит всё сразу - системная инструкция сервиса, вся история переписки, приложенные файлы и ответ, который модель ещё только собирается написать.
Модель не помнит предыдущие сообщения сама по себе. При каждом вашем сообщении сервис заново отправляет ей всю переписку целиком. Поэтому длинный диалог дорожает с каждым шагом: на десятом сообщении отправляются не только эти десять строк, а вся цепочка от первой реплики.
Когда переписка перерастает окно, сервис вынужден что-то выбросить. Обычно выбрасывают самое старое - и вы получаете знакомый эффект: нейросеть «забыла», что вы просили в начале, потеряла формат, снова спрашивает то, что вы уже говорили. Часть сервисов вместо выбрасывания сжимает старую часть в краткий пересказ: тогда детали теряются мягче, но всё равно теряются.
| Модель | Контекстное окно |
|---|---|
| YandexGPT 5 Pro | 32 000 токенов |
| GigaChat 2 Max | 128 000 токенов |
| DeepSeek V4 | около 1 000 000 токенов |
| Gemini 3.6 Flash | 1 000 000 токенов |
| GPT-5.6 Sol | около 1 050 000 токенов |
| Claude Opus 5 и Sonnet 5 | 1 000 000 токенов |
Оговорка по доступности: ChatGPT, Gemini и Claude официально из России не работают, это факт, который стоит учитывать при выборе. Российские сервисы и DeepSeek доступны напрямую.
Большое окно не равно хорошей памяти
Здесь честный минус, о котором в обзорах обычно молчат. Миллион токенов контекста не означает, что модель одинаково внимательно относится ко всему, что там лежит. На длинных документах качество внимания к середине текста проседает: начало и конец модель держит лучше, чем то, что оказалось посередине. Это устойчиво воспроизводимое поведение, а не особенность одной модели.
Практический вывод: если нужен точный ответ по конкретному месту большого документа, надёжнее вырезать этот фрагмент и отправить отдельно, чем закидывать все 200 страниц и надеяться, что модель найдёт нужный абзац сама.
Токены посчитали. А задачу под них кто поставит?
Умение уложиться в контекстное окно окупается только тогда, когда за ним стоит понятная работа. В четырёх бесплатных видео показываем, где нейросети реально встают в задачи интернет-маркетолога: сбор запросов, тексты объявлений, разбор рекламных кабинетов. Маршрут и инструменты, без обещаний дохода.
Почему ответ обрывается на полуслове
Обрыв ответа выглядит как сбой, но почти всегда это упирание в один из двух потолков. Различать их полезно, потому что лечатся они по-разному.
Потолок первый: лимит на длину ответа
Кроме общего контекстного окна у моделей есть отдельный предел на длину одного ответа. У GPT-5.6 Sol и у Claude Opus 5 это до 128 000 токенов, в интерфейсах бесплатных чатов лимит обычно намного скромнее. В API он задаётся параметром - и если разработчик выставил его низко, ответ оборвётся ровно на этом месте, даже когда в окне ещё полно места.
Симптом: текст останавливается посреди предложения или посреди пункта списка, без всякого предупреждения. Лечение простое - написать «продолжи с того места, где остановился». Модель допишет хвост. Если ответы обрываются постоянно, просите сразу более короткий формат или дробите задачу: не «напиши всю инструкцию», а «напиши раздел 1, потом попрошу второй».
Потолок второй: кончилось контекстное окно
Симптом другой: модель не обрывается, а начинает отвечать невпопад, теряет ранее заданные правила, переспрашивает то, что уже обсуждали. Часть сервисов честно пишет, что диалог слишком длинный и предлагает начать новый чат.
Лечение - начать новый чат и перенести туда только суть: короткое резюме задачи, нужные фрагменты документов, требования к формату. Переносить всю переписку смысла нет, вы просто заново упрётесь в тот же предел.
Как отличить одно от другого за десять секунд
- Ответ оборвался, но по смыслу был правильный до последнего слова - это лимит длины ответа. Просите продолжение.
- Ответ полный, но модель забыла условия из начала разговора - кончилось окно. Начинайте новый чат.
- Ответ полный и по делу, но проигнорировал часть приложенного файла - вероятнее всего, файл целиком в окно не поместился и его подрезали. Дробите документ.
Отдельный случай - когда сервис вообще отказывается принимать файл и пишет про превышение лимита. Здесь уговоры не помогут: нужно уменьшать объём на входе.
Как посчитать токены своего текста: три способа
Точно - через токенизатор конкретной модели. У Yandex и GigaChat для этого есть бесплатные методы. Приблизительно - разделить количество знаков на 2,5.
Оценка на глаз годится для прикидки, но если вы собираетесь платить за токены или упираетесь в лимит регулярно, считать нужно точно. У каждой модели свой словарь, поэтому единственный честный ответ даёт токенизатор именно той модели, с которой вы работаете.
Способ 1. Прикидка по знакам - за 5 секунд
Откройте текст в любом редакторе, посмотрите количество знаков с пробелами и разделите на 2,5 для русского языка или на 4 для английского. Для смешанного текста берите 3. Точность такой оценки - плюс-минус 20 процентов, и этого хватает, чтобы понять, влезаете вы в окно или нет. Не хватает - когда речь про счёт за большие объёмы.
Способ 2. Официальный токенизатор российских сервисов
У обеих крупных российских платформ есть отдельные методы, которые считают токены и ничего не генерируют.
- Yandex AI Studio - методы Tokenize в API генерации текста. Подсчёт токенов до отправки запроса не тарифицируется, платите вы только за саму генерацию.
- GigaChat - запрос POST /tokens/count. Отправляете список строк и название модели, в ответ получаете количество токенов по каждой строке. В официальном Python-пакете это метод tokens_count.
Минус способа очевиден: нужен доступ к API и хотя бы минимальные технические навыки. Для человека, который просто пишет в чат, это перебор.
Способ 3. Онлайн-токенайзеры
В сети есть бесплатные страницы, куда можно вставить текст и увидеть разбивку на токены с подсветкой каждого куска. Пользоваться ими стоит с одной оговоркой: почти все они считают по словарю зарубежных моделей. Для оценки объёма это нормально - порядок цифр верный. Для точного расчёта счёта в российском сервисе - нет, потому что словарь у него свой и результат разойдётся.
Мини-процедура перед большой задачей
- Посчитайте знаки в исходнике и разделите на 2,5 - получите вход в токенах.
- Прикиньте, какой длины нужен ответ, и переведите его в токены тем же способом.
- Сложите вход и ответ, добавьте 15 процентов запаса на служебные инструкции сервиса.
- Сравните с окном модели. Если вышло больше половины окна, заранее решайте, как дробить.
Как из токенов складывается счёт за API
Платите вы за токены запроса и ответа. У российских сервисов цена измеряется в рублях за 1000 токенов и различается по моделям в десять раз.
В бесплатном чате токены - это просто лимит. В API это деньги. Логика везде одинаковая: считаются токены, которые вы отправили, и токены, которые модель написала в ответ. У зарубежных провайдеров это ещё и разные цены: например, у Claude Opus 5 вход стоит 5 долларов за миллион токенов, а выход - 25, то есть ответ в пять раз дороже запроса. У Sonnet 5 - 3 и 15 долларов соответственно.
Российские сервисы продают токены пакетами в рублях. Вот действующие пакеты GigaChat на генерацию текста для физических лиц, цены с НДС, пакет действует 12 месяцев со дня оплаты. У юрлиц линейка своя и начинается с гораздо больших объёмов. В правой колонке - что из этого выходит за 1000 токенов.
| Пакет | Цена | За 1000 токенов |
|---|---|---|
| 20 млн токенов Lite | 1 300 ₽ | 0,065 ₽ |
| 100 млн токенов Lite | 6 500 ₽ | 0,065 ₽ |
| 3 млн токенов Pro | 1 500 ₽ | 0,50 ₽ |
| 15 млн токенов Pro | 7 500 ₽ | 0,50 ₽ |
| 3 млн токенов Max | 1 950 ₽ | 0,65 ₽ |
| 15 млн токенов Max | 9 750 ₽ | 0,65 ₽ |
Разница между младшей и старшей моделью - ровно в десять раз. Это и есть главный рычаг экономии: половину типовых задач вроде классификации писем или короткой выжимки нормально закрывает младшая модель.
Условный расчёт: 100 страниц через API
Пример намеренно упрощён и нужен только чтобы показать порядок цифр. Допустим, надо сделать краткую выжимку из 100 страниц А4.
- Вход: 100 страниц по 1800 знаков - это 180 000 знаков, делим на 2,5, получаем около 72 000 токенов.
- Ответ: пусть выжимка выйдет на 20 страниц - около 14 000 токенов.
- Итого около 86 000 токенов. На старшей модели по 0,65 ₽ за тысячу это примерно 56 ₽, на младшей по 0,065 ₽ - около 6 ₽.
Цифры оценочные: реальный расход зависит от того, как модель разобьёт именно ваш текст, и от служебных инструкций, которые сервис добавляет к каждому запросу. Но масштаб виден - разовые задачи стоят рублей, а не тысяч. Тысячи набегают там, где запросы идут потоком: чат-бот на сайте, обработка выгрузок, ежедневные отчёты.
Про бесплатные лимиты
У GigaChat есть freemium-режим для физических лиц: пакет бесплатных токенов с обновлением раз в 12 месяцев, распределённый между моделями Lite, Pro, Max и Ultra. Это тарифная акция - конкретные цифры производитель меняет, и перед расчётом бюджета их надо смотреть в актуальных тарифах, а не в статье. У Yandex AI Studio бесплатным остаётся подсчёт токенов, генерация тарифицируется.
6 приёмов уложиться в лимит токенов
Приёмы отсортированы по отдаче: первые дают больше всего экономии при наименьшей потере качества. И сразу оговорка, которой не бывает в подборках советов: экономия токенов почти всегда стоит качества. Задача не урезать всё до предела, а убрать балласт и остановиться до того, как модель начнёт додумывать.
1. Начинайте новый чат при смене темы
Самый недооценённый приём. Каждое сообщение тянет за собой всю переписку, поэтому длинный чат про пять разных задач - это пять задач, за каждую из которых вы платите пятикратно. Закончили тему - откройте новый диалог и перенесите туда только итог предыдущего в двух-трёх строках.
2. Не переклеивайте документ на каждом шаге
Типовая ошибка: приложить файл, получить ответ, приложить тот же файл снова с уточнением. Модель уже видит его в истории диалога - повторная вставка удваивает расход. Если работаете через интерфейс, просто ссылайтесь на приложенное словами.
3. Режьте длинный текст по смыслу, а не по объёму
Когда документ в окно не влезает, дробить его надо по логическим границам: разделы, главы, блоки таблицы. Кусок, оборванный посреди мысли, даёт заметно худший ответ, чем чуть более длинный, но цельный. И к каждому куску добавляйте одно предложение контекста: что это за документ и что с ним делать.
4. Задавайте формат и объём ответа явно
Ответ - это тоже токены, а в зарубежных тарифах ещё и самые дорогие. «Дай пять пунктов, каждый до двух строк, без вступления» экономит больше, чем любая правка входного текста. Заодно избавляет от вводных абзацев вроде «отличный вопрос».
5. Чистите данные до отправки
Выгрузка на 40 колонок, из которых нужны три, - это тридцать семь колонок оплаченного мусора. Уберите лишние колонки, служебные поля, дубли и разметку. То же с логами: оставьте только строки нужного периода.
6. Держите короткую инструкцию вместо длинных вводных
Если задача повторяется, вынесите правила в один компактный блок и переиспользуйте его вместо того, чтобы каждый раз объяснять контекст заново. Хорошая инструкция редко длиннее 500-700 знаков.
Три заблуждения, из-за которых считают неправильно
- «Токен - это слово». Нет. В русском одно слово регулярно превращается в два-три токена, а лимит в 32 000 токенов - это не 32 000 слов, а примерно 12-15 тысяч.
- «Лимит считается только по моему запросу». Нет. Ответ модели входит в тот же лимит, и при длинных ответах он занимает большую часть окна.
- «У всех моделей токены одинаковые». Нет. Словари разные, и один и тот же текст в двух моделях даст разное число токенов - иногда с разницей в полтора раза.
И последнее. Если вы уложились в лимит, но качество ответа просело, не подкручивайте экономию дальше - вернитесь на шаг назад. Дешёвый неверный ответ дороже дорогого верного: его всё равно придётся переделывать.
Частые вопросы
Сколько символов в одном токене?
Для английского текста один токен - это в среднем около 4 символов или 0,75 слова. Для русского примерно 2-3 символа, потому что кириллица занимает вдвое больше места в кодировке, а формы слов реже попадают в словарь целиком. Рабочая прикидка для русского: количество знаков с пробелами разделить на 2,5.
Сколько токенов в одной странице А4?
Страница А4 - это примерно 1800 знаков с пробелами, то есть около 600-900 токенов русского текста. Точная цифра зависит от содержимого: обычная проза ближе к нижней границе, таблицы, числа и код - к верхней или выше неё.
Ответ нейросети тоже считается в токенах?
Да, и это ключевая деталь. В контекстное окно и в счёт входят и ваш запрос, и ответ модели, и вся предыдущая переписка. У зарубежных провайдеров выходные токены обычно дороже входных в несколько раз: у Claude Opus 5, например, 5 долларов за миллион входных и 25 за миллион выходных.
Почему нейросеть забыла, о чём мы говорили в начале разговора?
Переписка переросла контекстное окно, и старые сообщения из него выпали или были сжаты в короткий пересказ. Модель не хранит память между сообщениями сама - сервис каждый раз заново отправляет ей всю историю, и когда история не влезает, часть приходится отбрасывать. Лечится новым чатом, куда переносится только суть задачи.
Как узнать лимит токенов у конкретной нейросети?
Размер контекстного окна указан в документации модели. Ориентиры на август 2026: у YandexGPT 5 Pro это 32 000 токенов, у GigaChat 2 Max - 128 000, у DeepSeek V4 - около миллиона. Считать свой текст под этот лимит удобнее официальными методами: у Yandex AI Studio это Tokenize, у GigaChat - запрос POST /tokens/count.
Токены - это счётчик. Профессия - то, ради чего вы его крутите
Считать контекст и экономить лимиты полезно, но само по себе это не работа. Работа начинается там, где нейросеть закрывает задачу клиента и за это платят. Четыре бесплатных видео в Telegram - про вход в профессию интернет-маркетолога с нуля: какие задачи бывают, какие инструменты нужны и с чего начать первому проекту. Доход не гарантируем, даём маршрут и инструменты.
АМ