Ставите Ollama, спрашиваете модель «как тебя зовут», она отвечает, а следующим сообщением пишете «а что я спросил только что» — и получаете растерянное «не знаю, о чём вы». Это не баг и не глупая модель: Ollama API по умолчанию не хранит контекст между запросами. Разберёмся, почему так устроено, и как получить нормальный чат с памятью — без сторонних облачных сервисов, на своём сервере.
Подробнее →