Digital Core

Словарь

Что такое токены в нейросети и сколько они стоят

Что такое токены в нейросети: это кусочки текста, которыми модель читает и пишет, и именно в них поставщики считают лимиты и оплату. Разбираем, сколько токенов уходит на проверку договора, разбор звонка и диалог бота, и как перевести это в рубли по тарифу вашего поставщика.

Обновлено 29.09.2026

Коротко

  • Токен - часть слова, целое короткое слово или знак препинания. Модель работает не со словами, а с токенами.
  • Оплата по API идет за входные и выходные токены, часто по разной цене.
  • Страница делового текста - порядка нескольких сотен токенов, договор на 10 страниц - несколько тысяч.
  • Диалог бота дороже суммы сообщений: при каждом ответе модель заново читает инструкцию и историю.
  • Экономят на коротком системном промпте, поиске по базе вместо всей базы и легких моделях для простых шагов.

Токены в нейросети простыми словами

Токен - это минимальный кусочек текста, с которым работает языковая модель. Иногда это целое короткое слово, иногда часть длинного слова, иногда пробел с запятой. Слово «распознавание» модель может разрезать на два-три токена, а «да» - прочитать одним.

Как именно резать текст, решает токенизатор конкретной модели. Поэтому один и тот же абзац у GigaChat, YandexGPT и зарубежных моделей превращается в разное число токенов. Модели, которые изначально учили на русском, обычно режут русский текст экономнее.

Токены важны бизнесу по двум причинам.

  • Цена. При работе через API нейросети вы платите за токены: входные (что отправили) и выходные (что модель написала).
  • Лимит. У каждой модели есть контекстное окно: сколько токенов она может прочитать за один раз вместе с ответом.

Калькулятор: сколько токенов уходит на договор, звонок и диалог бота

Ниже ориентиры для трех типовых задач. Числа приблизительные: точное количество зависит от модели, и его показывает счетчик токенов у поставщика. Но порядок цифр помогает прикинуть бюджет до старта.

ЗадачаЧто отправляется в модельВходные токеныВыходные токены
Проверка договора на 10 страницТекст договора, инструкция с чек-листом рисковоколо 7-10 тысяч1-2 тысячи: список замечаний
Разбор звонка на 10 минутРасшифровка разговора, карта критериев оценкиоколо 3-5 тысяч500-1 000: оценка и резюме
Диалог бота из 8 ответовПри каждом ответе: системный промпт, фрагменты базы знаний, история перепискиоколо 25-40 тысяч за весь диалог1-2 тысячи за весь диалог

Как перевести токены в рубли

Формула одна для всех поставщиков:

Стоимость = входные токены / 1 000 × цена входа + выходные токены / 1 000 × цена выхода

Цены берите из актуального тарифа поставщика: они меняются и отличаются для разных версий моделей. Для примера возьмем условный тариф 1 рубль за 1 000 токенов на вход и выход. Это не цена конкретного сервиса, а удобное число для счета.

  • Договор: около 10 тысяч входных и 1,5 тысячи выходных токенов - примерно 11-12 условных рублей за документ.
  • Звонок: около 4 тысяч и 700 токенов - примерно 5 условных рублей. Плюс распознавание речи, которое обычно считают по минутам аудио, а не по токенам.
  • Диалог бота: около 30 тысяч и 1,5 тысячи токенов - примерно 30 условных рублей.

Теперь умножьте на свой объем: сколько договоров, звонков и диалогов в месяц. Подставьте реальный тариф вместо условного, и получится бюджет на модель. Разбор тарифов конкретных сервисов - в статьях GigaChat API и YandexGPT API.

Почему диалог бота стоит дороже, чем кажется

Клиент написал боту короткое «а доставка есть?». Кажется, это пять токенов. На деле модель получает гораздо больше:

  1. системный промпт: кто бот, как говорит, что нельзя обещать;
  2. найденные фрагменты базы знаний: условия доставки, зоны, цены;
  3. всю предыдущую переписку, чтобы не потерять контекст;
  4. и только потом сам вопрос.

Модель не помнит прошлые сообщения сама. Поэтому история отправляется заново при каждом ответе, и к восьмому сообщению вход растет в несколько раз. Это нормально, но это нужно учитывать при расчете. В статье сколько стоит чат-бот разобраны и остальные статьи расходов.

Как экономить токены без потери качества

  • Короткий системный промпт. Правила без воды и повторов. Каждая лишняя строка оплачивается в каждом ответе.
  • Поиск вместо всей базы. В модель уходят 3-5 нужных фрагментов, а не весь прайс. Так работает RAG.
  • Сжатие истории. Длинную переписку заменяют короткой сводкой: что клиент хочет, что уже выяснили.
  • Легкая модель для простых шагов. Определить тему письма или язык сообщения может облегченная версия модели, например линейки Lite у GigaChat и YandexGPT. Сложный ответ - старшая модель.
  • Лимит длины ответа. Клиенту в мессенджере не нужна страница текста.
  • Только нужные разделы документа. Для проверки сроков оплаты не обязательно отправлять весь договор с приложениями.

Токены, контекстное окно и лимиты

Контекстное окно - это сколько токенов модель удерживает за раз: вход вместе с ответом. Если договор с приложениями не помещается, его делят на части или ищут в нем нужные фрагменты. Размеры окна у моделей, доступных в России, сравниваются на странице про LLM.

Еще одна путаница - подписка и API. Подписка на чат-сервис дает человеку работать в окне браузера, лимиты задает тариф. API оплачивается по токенам и нужен, когда нейросеть встроена в бота, CRM или обработку документов. Подробнее - в статье про API нейросети.

Вопросы

Частые вопросы

Что такое токены в нейросети простыми словами?

Это кусочки текста, на которые модель режет все, что читает и пишет. В токенах считают и лимит длины текста, и оплату за работу модели через API.

Сколько токенов в одном слове?

По-разному: короткое частое слово может быть одним токеном, длинное - двумя-четырьмя. Зависит от модели и языка, точное число покажет счетчик токенов поставщика.

Сколько стоит 1 000 токенов?

Цена зависит от поставщика и версии модели и указывается в его тарифе. Часто вход и выход стоят по-разному, а облегченные модели дешевле старших.

Почему русский текст расходует больше токенов?

Токенизаторы многих зарубежных моделей учились в основном на английском и режут русские слова на более мелкие части. У моделей, обученных на русском, это заметно меньше.

Что будет, если текст не помещается в лимит токенов?

Модель не сможет прочитать его целиком: запрос вернет ошибку или часть текста потеряется. Длинные документы делят на части или ищут в них нужные фрагменты перед отправкой.

Покажем на
вашей задаче

Оставьте заявку - свяжемся в рабочее время и бесплатно покажем, как это будет работать у вас.

+7 912 587-60-85info@digital-core.ru

Или напишите в Telegram · +7 912 587-60-85

Позвонить