«Модель поддерживает 128k контекста» — строка из карточки, которая не говорит, сколько это весит в оперативной памяти и сколько токенов останется на ответ после истории диалога. Контекстное окно — это общий бюджет токенов, а не резиновая величина, и его нехватка выглядит не как понятная ошибка, а как модель, которая вдруг «забыла» начало разговора или обрывает ответ на полуслове. Разберём, как токены считаются для русского текста, откуда берётся память под контекст и как посчитать её заранее — а не по факту падения сервиса.
Подробнее →