Пользователь отправляет вопрос в чат-бота и несколько секунд смотрит на пустой экран — а потом текст появляется весь целиком, будто модель «подумала» и разом выдала готовый ответ. Это иллюзия: на самом деле почти все современные ИИ-чаты показывают вам не готовый ответ, а поток токенов, который печатается по мере генерации, как в терминале с tail -f. Разница между «подождать и получить всё сразу» и «видеть, как печатается» — не косметика интерфейса, а конкретный протокол поверх HTTP, который стоит понимать, если вы собираете свой чат-бот, прокси к API…
Подробнее →