Счётчик токенов в ответе API или ошибка «context length exceeded» упираются в механику, которую большинство пользователей LLM никогда не видели: модель не читает буквы и не читает слова — она читает числа, полученные разбиением текста на куски по заранее обученному словарю. Пока это чёрный ящик, непонятно, почему короткая фраза на русском стоит дороже похожей на английском, а аккуратный JSON съедает лимит быстрее, чем сплошной текст того же размера. Разберём, как токенизация устроена внутри и что из этого следует на практике — без придуманных точных…
Подробнее →