СЧЁТЧИК ТОКЕНОВ
Модель не считает слова. Она считает токены — куски, на которые она разрезала текст ещё до того, как его увидела. Счёт выставляется в них же.
o200k_base — GPT-4o и новее. cl100k_base — GPT-4 и GPT-3.5.
Учтены первые 20 000 символов.
Текст не покидает браузер. Ничего не сохраняется и никуда не отправляется.
ПОЧЕМУ РУССКИЙ ТЕКСТ ОБХОДИТСЯ ДОРОЖЕ
Проверка простая. Один и тот же текст, переведённый дословно, пропущен через обе кодировки.
Русская версия: 613 символов, 98 слов. Английская: 656 символов, 123 слова. Английская длиннее на 43 символа и на 25 слова.
В кодировке o200k_base русский вариант стоит 173 токена, английский — 150. В кодировке cl100k_base русский стоит 287 токенов. Английский — снова 150.
То есть английский текст в обеих кодировках оценён одинаково, до токена. Совпадение проверено отдельно: это не сбой счёта. Русский текст в старой кодировке стоит более чем в полтора раза дороже, чем в новой, — за те же самые слова.
Отсюда практическое следствие. Длинный системный промпт на русском языке в модели поколения GPT-4 расходует почти вдвое больше бюджета, чем его английский перевод. Модель об этом не предупреждает. Счёт приходит потом.
ЧЕГО СЧЁТЧИК НЕ УМЕЕТ
Здесь не запущен настоящий токенизатор — он весит слишком много для страницы. Вместо него работает формула, настроенная по реальным замерам на текстах этого сайта.
На обычном тексте средняя ошибка составляет около 5,5 % для o200k_base и около 4,1 % для cl100k_base. Проверено на текстах, которые в настройке не участвовали.
Проверить можно не отходя. Текст в поле выше — тот самый, на котором сделан замер. Настоящий токенизатор насчитал в нём 287 токенов для cl100k_base. Счётчик показывает 284. Расхождение — 1,0 %. В строке o200k_base он попал в цель без ошибки, но это удача, а не правило.
Хуже всего счётчик справляется с тремя вещами. Ссылки и адреса он переоценивает: настоящий токенизатор знает домены целиком. Имена переменных вида API_KEY_CONSTANT он тоже переоценивает, и по той же причине. Эмодзи считаются по усреднённой цене, а семейные и флаговые последовательности стоят в несколько раз дороже обычных.
Для Claude и Gemini счётчика здесь нет. Их токенизаторы не опубликованы.
Точный ответ знает только сама модель. Сообщать его она не обязана.
ЧАСТЫЕ ВОПРОСЫ
Сколько токенов в одном русском слове?
В среднем около двух в кодировке o200k_base и около трёх в cl100k_base. Точное число зависит от слова: частые слова режутся крупными кусками, редкие — мелкими.
Почему показаны два числа, а не одно?
Это две разные кодировки. o200k_base используется в GPT-4o и более новых моделях, cl100k_base — в GPT-4 и GPT-3.5. Одна и та же строка стоит в них по-разному.
Подходит ли этот счёт для Claude или Gemini?
Нет. У них собственные токенизаторы, и они не опубликованы. Числа на этой странице относятся только к двум кодировкам OpenAI.
Насколько точен результат?
Это оценка, а не подсчёт. Средняя ошибка на обычном тексте — около 5,5 % для o200k_base и около 4,1 % для cl100k_base. На ссылках, коде и именах переменных ошибка заметно выше.
Отправляется ли текст на сервер?
Нет. Расчёт целиком происходит в браузере. Ни текст, ни его длина никуда не передаются.