Какую модель Ollama поставить на 8 ГБ RAM
С 4 ГБ RAM выбор модели для Ollama сводится к компромиссу: либо 1,5–3 млрд параметров, либо своп и риск OOM-killer при первом же длинном запросе. На 8 ГБ разговор меняется — в диапазон уверенно заходит целый класс моделей 7B-8B, которые заметно осмысленнее отвечают, лучше держат инструкции и меньше путаются в контексте. Вопрос уже не «влезет ли вообще», а «какую именно модель 7B-8B взять и в каком квантовании», и здесь легко переплатить памятью впустую или, наоборот, поставить модель, которая формально влезает, но не оставляет запаса ни на контекст, ни на что-либо ещё на сервере. Ниже — конкретный список моделей под 8 ГБ, расчёт по квантованию и таблица команд запуска. Про диапазон 4 ГБ и модели 1-4 млрд параметров подробно разбирали отдельно: какую модель Ollama поставить на 4 ГБ RAM, в этой статье эта часть не повторяется.
Содержание
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Чем 8 ГБ принципиально отличается от 4 ГБ
Разница не только в том, что «модель побольше влезает». На 4 ГБ верхняя граница — это модели 3–3,8 млрд параметров, которые дают короткие, часто упрощённые ответы и слабо держат сложные многошаговые инструкции. На 8 ГБ появляется класс 7B-8B — те же архитектуры (Llama, Qwen, Mistral, Gemma), но с существенно бо́льшим числом параметров, а значит и бо́льшей ёмкостью знаний и связностью рассуждений. На практике это ощущается как переход от «модели, которая отвечает на вопрос» к «модели, которая понимает контекст вопроса»: меньше повторов, точнее следование системному промпту, приличнее код и математика в пределах пары шагов рассуждения.
Второе отличие — запас. На 4 ГБ почти вся память уходит под саму модель, свободного места под увеличенный контекст или второй процесс нет. На 8 ГБ даже с моделью 7B в Q4 остаётся 1–1,5 ГБ, которых достаточно под контекст в несколько тысяч токенов и лёгкие фоновые сервисы — например, панель управления или обратный прокси перед API.
Третье — сама точность квантования становится менее болезненной темой. На 4 ГБ Q4 — это часто вынужденный минимум, ниже которого модель заметно теряет в качестве. На 8 ГБ для 7B-модели Q4_K_M — комфортный стандартный выбор с запасом, а не предел возможностей сервера.
Сколько RAM нужно модели 7B-8B: расчёт по квантованию
Логика расчёта та же, что и для 4 ГБ: вес GGUF-файла зависит от числа параметров и битности квантования, а RAM нужна с запасом сверх файла — под KV-кэш контекста, служебную память процесса Ollama и операционную систему.
Размер (ГБ) ≈ Параметры (млрд) × Биты на параметр / 8
Для Q4_K_M — около 0,6 ГБ на каждый миллиард параметров, для Q5_K_M — около 0,7 ГБ/млрд. Модель на 7–8 млрд параметров в Q4_K_M даёт файл примерно 4,4–4,8 ГБ, та же модель в Q5_K_M — уже 4,9–5,6 ГБ. Разница между Q4 и Q5 не в разы, но на границе доступной памяти каждые несколько сотен мегабайт решают, влезет модель с запасом или будет постоянно балансировать на грани свопа.
Минимальная RAM под модель — это файл, умноженный примерно на 1,2 (под KV-кэш и раннер), плюс 1–1,3 ГБ на систему и сам процесс Ollama. Для модели 7B в Q4_K_M (файл ~4,5 ГБ) это даёт ориентир около 6,7 ГБ — на VPS с 8 ГБ остаётся заметный запас. Для той же модели в Q5_K_M (файл ~4,9 ГБ) минимум поднимается примерно до 7,1 ГБ — запас уже скромнее, но всё ещё есть. Для модели 8-9 млрд параметров в Q5 расчёт легко упирается в потолок в 8 ГБ или превышает его — это уже зона риска, а не комфортный выбор.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaТаблица: какие модели 7B-8B помещаются в 8 ГБ с запасом
Список актуальных на конец августа 2026 года моделей, которые реально ставят на VPS с 8 ГБ RAM. Размеры файлов и минимальная RAM — расчётные значения по формуле квантования, у конкретной сборки они могут отличаться на десятые доли гигабайта:
| Модель | Квант | Файл (прибл.) | Мин. RAM с запасом | Для чего годится |
|---|---|---|---|---|
| Qwen2.5 7B | Q4_K_M | ~4,5 ГБ | ~6,5 ГБ | сильный RU/EN-чат, следование инструкциям |
| Qwen2.5-Coder 7B | Q4_K_M | ~4,5 ГБ | ~6,5 ГБ | код, автодополнение, рефакторинг |
| Mistral 7B | Q4_K_M | ~4,4 ГБ | ~6,4 ГБ | компактный универсальный чат на английском |
| Llama 3.1 8B | Q4_K_M | ~4,7 ГБ | ~6,8 ГБ | универсальный чат, база под агентов |
| DeepSeek-R1 8B (дистилляция) | Q4_K_M | ~4,9 ГБ | ~7 ГБ | рассуждения по шагам, chain-of-thought |
| Gemma2 9B | Q4_K_M | ~5,4 ГБ | ~7,5 ГБ (впритык) | сильное следование инструкциям от Google |
| Qwen2.5 7B | Q5_K_M | ~4,9 ГБ | ~7,1 ГБ | то же, но точнее в деталях и нюансах |
| Llama 3.1 8B | Q5_K_M | ~5,6 ГБ | ~7,9 ГБ (на грани) | максимум качества, почти без запаса |
Верхние пять строк — разумный стандартный выбор для 8 ГБ: Q4_K_M, комфортный запас под контекст в 4–8 тысяч токенов и параллельную работу лёгкой панели или прокси рядом. Gemma2 9B в Q4 уже требует лёгкого сервера без посторонних процессов. Строки с Q5_K_M — для случая, когда сервер выделен исключительно под Ollama, контекст короткий и хочется выжать из модели чуть больше точности; Llama 3.1 8B в Q5 на 8 ГБ — это уже граница, а не запас, и любой параллельный запрос рискует уйти в своп.
Q4 или Q5 на 8 ГБ — когда есть смысл повышать квант
По умолчанию Ollama тянет Q4_K_M практически для всех моделей — это разумный выбор в большинстве сценариев на 8 ГБ. Разница между Q4_K_M и Q5_K_M на практике не радикальная: чуть точнее счёт в многошаговых задачах, чуть меньше потерь в нюансах формулировок, но это не тот скачок качества, ради которого стоит рисковать OOM-киллером на сервере, где параллельно крутится что-то ещё.
Повышать квант до Q5 имеет смысл, если одновременно верно всё из следующего: сервер выделен только под одну модель Ollama, контекст короткий и предсказуемый (не увеличивается динамически в процессе диалога), а задача чувствительна к точности — например, код с строгими требованиями к синтаксису или расчёты, где важна каждая цифра. Во всех остальных случаях Q4_K_M на 7B-8B — более безопасный выбор с точки зрения стабильности сервиса, чем Q5 без запаса.
Явно указать квантование можно тегом при загрузке:
ollama pull qwen2.5:7b-instruct-q4_K_M
ollama pull qwen2.5:7b-instruct-q5_K_M
Если в каталоге модели на ollama.com для нужной версии нет отдельного тега под конкретный квант — по умолчанию тянется Q4_K_M, и явно указывать суффикс не обязательно.
Установка и проверка занятой памяти
Установка не отличается от любого другого объёма RAM:
curl -fsSL https://ollama.com/install.sh | sh
Для универсального старта на 8 ГБ разумный выбор — Qwen2.5 7B:
ollama run qwen2.5:7b
Если модель предполагается дёргать из своего бэкенда, а не через интерактивный терминал, достаточно скачать её один раз:
ollama pull qwen2.5:7b
и обращаться к ней через HTTP API:
curl http://127.0.0.1:11434/api/generate -d '{
"model": "qwen2.5:7b",
"prompt": "Сформулируй план миграции базы данных в трёх шагах",
"stream": false
}'
После первого ответа стоит сразу свериться с реальным потреблением памяти, а не полагаться на расчётные цифры из таблицы:
ollama ps
free -h
Колонка SIZE в ollama ps показывает фактический объём, занятый моделью в памяти. Если он заметно больше расчётного — вероятно, включён длинный num_ctx по умолчанию для конкретной сборки модели; сократить контекст можно параметром при запросе к API ("options": {"num_ctx": 4096}) или в Modelfile. Подробнее о причинах медленной или нестабильной генерации токенов — не только из-за нехватки памяти, но и упора в CPU или диск — в статье Ollama медленно генерирует токены.
Когда 8 ГБ всё ещё мало
8 ГБ закрывает одну модель 7B-8B в Q4 с разумным запасом, но у диапазона тоже есть потолок. Стоит присматриваться к 16 ГБ и выше, если верно хотя бы одно из следующего:
- нужна модель от 12-14 млрд параметров и крупнее — даже в Q4_K_M такие модели уже не оставляют запаса на 8 ГБ;
- параллельно с основной чат-моделью планируется держать embedding-модель для RAG — это отдельный процесс со своей памятью, а не надстройка над существующей;
- контекст регулярно превышает 8–16 тысяч токенов — KV-кэш на таких объёмах начинает занимать гигабайты, а не десятки мегабайт;
- Ollama работает не в одиночку, а рядом с полноценным стеком — базой данных, Open WebUI, обратным прокси с TLS-терминацией — и всем этим сервисам тоже нужна память постоянно.
Сводную таблицу минимальных требований по разным объёмам RAM, не только 4 и 8 ГБ, мы собирали отдельно: сколько RAM нужно для Ollama. Если после её сверки видно, что нужного запаса на 8 ГБ не остаётся — дешевле сразу перейти на VPS с бо́льшим объёмом памяти, чем терять время на подбор компромиссного квантования и разбор падений по OOM.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.
Развернуть OllamaОбсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Хватит ли 8 ГБ, если Ollama делит сервер с Open WebUI или панелью управления?
Для модели 7B в Q4 — да, обычно с запасом: такие сервисы съедают 300–700 МБ. Для 9B в Q4 или 7-8B в Q5 запаса может уже не хватить — стоит проверить фактическое потребление через free -h до и после запуска соседних сервисов.
Дают ли модели 7B-8B заметно лучшие ответы, чем 3B, или разница преувеличена?
Разница реальная, особенно на многошаговых задачах и следовании системным инструкциям — модели 7B-8B меньше теряют нить и меньше повторяются. На простых задачах вроде классификации или коротких ответов разница может быть не так заметна, и 3B справится не хуже.
Можно ли поставить сразу две модели 7B на 8 ГБ и переключаться между ними?
Хранить на диске — без проблем, обе скачиваются заранее. Но одновременно в памяти на 8 ГБ комфортно помещается только одна модель 7B в Q4 — Ollama выгружает предыдущую модель при обращении к другой, если не хватает места, так что параллельной работы обеих не будет.
Стоит ли сразу ставить Q5 вместо Q4, раз память вроде позволяет?
Только если сервер выделен исключительно под одну модель и контекст стабильно короткий. Если это единственный сервис на VPS без соседей — Q5 для 7B даёт небольшой прирост точности с приемлемым запасом; для 8-9B моделей в Q5 запаса на 8 ГБ обычно уже не остаётся.
Как понять, что модель конкретно 7B, а не её более крупный вариант из той же линейки?
Смотреть на суффикс тега при загрузке — qwen2.5:7b, llama3.1:8b — и сверять размер файла в карточке модели на ollama.com перед ollama pull, а не полагаться на название линейки без цифры.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.