Skip to content
Neuronavt
Go back

Как токенизаторы меняют цену русского текста

Исследование7/10

Коротко

Автор сравнил 11 токенизаторов и показал, что одинаковый объём русского текста у разных моделей превращается в очень разное число токенов. Поэтому для русскоязычного продукта важнее оценивать стоимость типичных запросов в символах или на собственных данных, а не сравнивать только цену за миллион токенов.

Контекст

Автор статьи самостоятельно подготовил четыре пары коротких русских и английских текстов разных жанров и измерил, как их разбивают токенизаторы моделей GPT, Claude, Gemini, DeepSeek, Qwen, GLM, Kimi, Grok, GigaChat и YandexGPT. Задача — сделать сравнение расходов на API осмысленным для русскоязычных сервисов, где единица тарификации — токен, но размер токена зависит от модели и языка.

Главное

Как сделано

Для моделей с открытыми токенизаторами автор считал токены локально: среди использованных решений — tiktoken с o200k_base и cl100k_base, а также файлы tokenizer.json и tokenizer.model из официальных или связанных с разработчиками репозиториев. Для закрытых моделей использовался usage.prompt_tokens API и вычитание результата для базового короткого запроса из результата для того же запроса с добавленным текстом. Формула: usage(«Ответь одним словом: ок.\n\n» + текст) − usage(«Ответь одним словом: ок.»). Так автор пытался исключить служебные токены шаблона чата и шлюза; запросы ограничивались max_tokens=16.

Для каждого токенизатора сравнивались четыре пары текстов: технический абзац, диалог поддержки, деловое уведомление и Python-код с комментариями. Затем токенизацию сопоставили с медианными ценами входных токенов у доступных в России сервисов на 27.09.2026 и пересчитали расходы на 1 000 символов. Цены в этой части — ориентир для сравнения, а не обещание конкретного счёта.

Результаты

В тесте русский текст вмещал от примерно 1 символа на токен у Claude Opus 5 до примерно 5 у YandexGPT 5 Lite и GigaChat 3 — разница примерно пятикратная. Для большинства моделей английские тексты давали около 5 символов на токен. По сравнению с английским русская проза занимала на 18–23% больше токенов у OpenAI o200k_base, Gemini, Grok и GLM; на 38% больше у DeepSeek, на 52% у Qwen и на 86% у Kimi. У Claude Opus 5 показатель был почти втрое выше, тогда как у YandexGPT и GigaChat русский текст занимал немного меньше токенов, чем английский.

Сравнение cl100k_base и o200k_base показало для русского рост с 2,29 до 4,01 символа на токен. В ценовом расчёте Opus 5 при медианной цене 549,31 ₽ за миллион входных токенов обходился примерно в 0,53 ₽ за 1 000 русских символов, а GPT-5.5 при 552 ₽ — примерно в 0,14 ₽; при одинаковой цене за токен эффект токенизатора означал бы для Opus почти в 3,9 раза больше токенов на один и тот же русский текст. Автор также отмечает, что выходные токены часто стоят в 3–5 раз дороже входных, поэтому длинные русские ответы могут усиливать разницу. Результаты и цены относятся к конкретным тестовым текстам, моделям и дате.

Ограничения

Выборка небольшая: четыре пары текстов и около 2 500 символов прозы на каждом языке; конкретные коэффициенты на реальных промптах могут отличаться. Закрытые токенизаторы измерялись через API-шлюзы, а для Gemini, GLM, Grok и Kimi независимой локальной сверки не было. Автор обнаружил случаи, когда usage агрегатора совпадал с o200k_base для моделей Claude, и не смог установить, пересчитывал ли токены шлюз или направлял запрос не в указанную модель. В ценовом сравнении использованы медианы по сервисам на 27.09.2026, тогда как фактические тарифы провайдеров могут отличаться в разы. Для GigaChat 2 Max применён токенизатор GigaChat 3, а Grok 4.6 оценён токенизатором Grok 4.7; оба переноса между версиями являются допущениями. В статье также советуют переводить служебные инструкции на английский для экономии токенов, но качество ответов при этом нужно проверять отдельно.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны таблицы по каждому жанру, сырые замеры, ссылки и код для повторения эксперимента на своих промптах.