Словарь
Что такое токены в нейросети и сколько они стоят
Что такое токены в нейросети: это кусочки текста, которыми модель читает и пишет, и именно в них поставщики считают лимиты и оплату. Разбираем, сколько токенов уходит на проверку договора, разбор звонка и диалог бота, и как перевести это в рубли по тарифу вашего поставщика.
Обновлено 29.09.2026
Коротко
- Токен - часть слова, целое короткое слово или знак препинания. Модель работает не со словами, а с токенами.
- Оплата по API идет за входные и выходные токены, часто по разной цене.
- Страница делового текста - порядка нескольких сотен токенов, договор на 10 страниц - несколько тысяч.
- Диалог бота дороже суммы сообщений: при каждом ответе модель заново читает инструкцию и историю.
- Экономят на коротком системном промпте, поиске по базе вместо всей базы и легких моделях для простых шагов.
Токены в нейросети простыми словами
Токен - это минимальный кусочек текста, с которым работает языковая модель. Иногда это целое короткое слово, иногда часть длинного слова, иногда пробел с запятой. Слово «распознавание» модель может разрезать на два-три токена, а «да» - прочитать одним.
Как именно резать текст, решает токенизатор конкретной модели. Поэтому один и тот же абзац у GigaChat, YandexGPT и зарубежных моделей превращается в разное число токенов. Модели, которые изначально учили на русском, обычно режут русский текст экономнее.
Токены важны бизнесу по двум причинам.
- Цена. При работе через API нейросети вы платите за токены: входные (что отправили) и выходные (что модель написала).
- Лимит. У каждой модели есть контекстное окно: сколько токенов она может прочитать за один раз вместе с ответом.
Калькулятор: сколько токенов уходит на договор, звонок и диалог бота
Ниже ориентиры для трех типовых задач. Числа приблизительные: точное количество зависит от модели, и его показывает счетчик токенов у поставщика. Но порядок цифр помогает прикинуть бюджет до старта.
| Задача | Что отправляется в модель | Входные токены | Выходные токены |
|---|---|---|---|
| Проверка договора на 10 страниц | Текст договора, инструкция с чек-листом рисков | около 7-10 тысяч | 1-2 тысячи: список замечаний |
| Разбор звонка на 10 минут | Расшифровка разговора, карта критериев оценки | около 3-5 тысяч | 500-1 000: оценка и резюме |
| Диалог бота из 8 ответов | При каждом ответе: системный промпт, фрагменты базы знаний, история переписки | около 25-40 тысяч за весь диалог | 1-2 тысячи за весь диалог |
Как перевести токены в рубли
Формула одна для всех поставщиков:
Стоимость = входные токены / 1 000 × цена входа + выходные токены / 1 000 × цена выхода
Цены берите из актуального тарифа поставщика: они меняются и отличаются для разных версий моделей. Для примера возьмем условный тариф 1 рубль за 1 000 токенов на вход и выход. Это не цена конкретного сервиса, а удобное число для счета.
- Договор: около 10 тысяч входных и 1,5 тысячи выходных токенов - примерно 11-12 условных рублей за документ.
- Звонок: около 4 тысяч и 700 токенов - примерно 5 условных рублей. Плюс распознавание речи, которое обычно считают по минутам аудио, а не по токенам.
- Диалог бота: около 30 тысяч и 1,5 тысячи токенов - примерно 30 условных рублей.
Теперь умножьте на свой объем: сколько договоров, звонков и диалогов в месяц. Подставьте реальный тариф вместо условного, и получится бюджет на модель. Разбор тарифов конкретных сервисов - в статьях GigaChat API и YandexGPT API.
Почему диалог бота стоит дороже, чем кажется
Клиент написал боту короткое «а доставка есть?». Кажется, это пять токенов. На деле модель получает гораздо больше:
- системный промпт: кто бот, как говорит, что нельзя обещать;
- найденные фрагменты базы знаний: условия доставки, зоны, цены;
- всю предыдущую переписку, чтобы не потерять контекст;
- и только потом сам вопрос.
Модель не помнит прошлые сообщения сама. Поэтому история отправляется заново при каждом ответе, и к восьмому сообщению вход растет в несколько раз. Это нормально, но это нужно учитывать при расчете. В статье сколько стоит чат-бот разобраны и остальные статьи расходов.
Как экономить токены без потери качества
- Короткий системный промпт. Правила без воды и повторов. Каждая лишняя строка оплачивается в каждом ответе.
- Поиск вместо всей базы. В модель уходят 3-5 нужных фрагментов, а не весь прайс. Так работает RAG.
- Сжатие истории. Длинную переписку заменяют короткой сводкой: что клиент хочет, что уже выяснили.
- Легкая модель для простых шагов. Определить тему письма или язык сообщения может облегченная версия модели, например линейки Lite у GigaChat и YandexGPT. Сложный ответ - старшая модель.
- Лимит длины ответа. Клиенту в мессенджере не нужна страница текста.
- Только нужные разделы документа. Для проверки сроков оплаты не обязательно отправлять весь договор с приложениями.
Токены, контекстное окно и лимиты
Контекстное окно - это сколько токенов модель удерживает за раз: вход вместе с ответом. Если договор с приложениями не помещается, его делят на части или ищут в нем нужные фрагменты. Размеры окна у моделей, доступных в России, сравниваются на странице про LLM.
Еще одна путаница - подписка и API. Подписка на чат-сервис дает человеку работать в окне браузера, лимиты задает тариф. API оплачивается по токенам и нужен, когда нейросеть встроена в бота, CRM или обработку документов. Подробнее - в статье про API нейросети.