В обычном чате контекст растёт линейно: вопрос, ответ, вопрос, ответ. У агента всё иначе — одна пользовательская задача разворачивается в десятки внутренних шагов: рассуждение, вызов инструмента, результат инструмента, снова рассуждение. Каждый такой шаг добавляет токены, и все они остаются в истории, потому что API стейтлесс — при каждом следующем запросе вы заново отправляете модели всю накопленную переписку. Разберём, почему контекст агента заполняется настолько быстрее, чем в диалоге, и какими способами это разгружают на практике.
Подробнее →