В карточке модели написано «контекст 128k токенов», и это звучит как готовая индульгенция: можно скормить модели весь проект, всю переписку, всю документацию разом. На практике сервер с той же моделью, что бодро отвечала на короткие вопросы, начинает тормозить и падать по памяти именно тогда, когда в диалог наконец загружают длинный документ. Разгадка не в том, что модель «врёт» про поддерживаемую длину — а в том, что поддержка длинного контекста и его реальное бесплатное использование на скромном железе — это два разных утверждения. Разберёмся, откуда…
Подробнее →