СЧЁТЧИК ТОКЕНОВ

Модель не считает слова. Она считает токены — куски, на которые она разрезала текст ещё до того, как его увидела. Счёт выставляется в них же.

Символов613
Слов98
Токенов · o200k_base173
Токенов · cl100k_base284

o200k_base — GPT-4o и новее. cl100k_base — GPT-4 и GPT-3.5.

Текст не покидает браузер. Ничего не сохраняется и никуда не отправляется.

ПОЧЕМУ РУССКИЙ ТЕКСТ ОБХОДИТСЯ ДОРОЖЕ

Проверка простая. Один и тот же текст, переведённый дословно, пропущен через обе кодировки.

Русская версия: 613 символов, 98 слов. Английская: 656 символов, 123 слова. Английская длиннее на 43 символа и на 25 слова.

В кодировке o200k_base русский вариант стоит 173 токена, английский — 150. В кодировке cl100k_base русский стоит 287 токенов. Английский — снова 150.

То есть английский текст в обеих кодировках оценён одинаково, до токена. Совпадение проверено отдельно: это не сбой счёта. Русский текст в старой кодировке стоит более чем в полтора раза дороже, чем в новой, — за те же самые слова.

Отсюда практическое следствие. Длинный системный промпт на русском языке в модели поколения GPT-4 расходует почти вдвое больше бюджета, чем его английский перевод. Модель об этом не предупреждает. Счёт приходит потом.

ЧЕГО СЧЁТЧИК НЕ УМЕЕТ

Здесь не запущен настоящий токенизатор — он весит слишком много для страницы. Вместо него работает формула, настроенная по реальным замерам на текстах этого сайта.

На обычном тексте средняя ошибка составляет около 5,5 % для o200k_base и около 4,1 % для cl100k_base. Проверено на текстах, которые в настройке не участвовали.

Проверить можно не отходя. Текст в поле выше — тот самый, на котором сделан замер. Настоящий токенизатор насчитал в нём 287 токенов для cl100k_base. Счётчик показывает 284. Расхождение — 1,0 %. В строке o200k_base он попал в цель без ошибки, но это удача, а не правило.

Хуже всего счётчик справляется с тремя вещами. Ссылки и адреса он переоценивает: настоящий токенизатор знает домены целиком. Имена переменных вида API_KEY_CONSTANT он тоже переоценивает, и по той же причине. Эмодзи считаются по усреднённой цене, а семейные и флаговые последовательности стоят в несколько раз дороже обычных.

Для Claude и Gemini счётчика здесь нет. Их токенизаторы не опубликованы.

Точный ответ знает только сама модель. Сообщать его она не обязана.

ЧАСТЫЕ ВОПРОСЫ

Сколько токенов в одном русском слове?

В среднем около двух в кодировке o200k_base и около трёх в cl100k_base. Точное число зависит от слова: частые слова режутся крупными кусками, редкие — мелкими.

Почему показаны два числа, а не одно?

Это две разные кодировки. o200k_base используется в GPT-4o и более новых моделях, cl100k_base — в GPT-4 и GPT-3.5. Одна и та же строка стоит в них по-разному.

Подходит ли этот счёт для Claude или Gemini?

Нет. У них собственные токенизаторы, и они не опубликованы. Числа на этой странице относятся только к двум кодировкам OpenAI.

Насколько точен результат?

Это оценка, а не подсчёт. Средняя ошибка на обычном тексте — около 5,5 % для o200k_base и около 4,1 % для cl100k_base. На ссылках, коде и именах переменных ошибка заметно выше.

Отправляется ли текст на сервер?

Нет. Расчёт целиком происходит в браузере. Ни текст, ни его длина никуда не передаются.