Запуск Llama 3 на своём сервере
Llama 3 от Meta — одна из сильнейших открытых моделей, и её можно держать целиком у себя. Разбираем три пути запуска: простой Ollama, гибкий llama.cpp и быстрый vLLM.
Содержание
Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Версии Llama 3 и сколько нужно ресурсов
Семейство Llama 3 включает модели 8B и 70B (плюс обновления 3.1/3.2). 8B комфортно живёт на скромном железе, 70B требует много VRAM или агрессивного квантования.
- 8B — 5–6 ГБ в 4-битном кванте, идёт даже на CPU.
- 70B — десятки ГБ, реалистично только с GPU или сильным квантом.
- Контекст — до 128K в версиях 3.1, но длинный контекст ест память.
Для 8B на CPU главное — быстрые ядра и диск: связка AMD EPYC + NVMe у MAATRIX даёт хороший отклик, а веса подгружаются с NVMe за секунды.
Прежде чем выбирать способ запуска, стоит трезво прикинуть, сколько токенов в секунду тебе нужно и сколько параллельных пользователей будет. Для личного ассистента или редких запросов от бэкенда 8B на CPU выдаёт вполне комфортные единицы токенов в секунду. Если же это публичный сервис с десятками одновременных сессий — без GPU и vLLM не обойтись. Понимание нагрузки заранее избавляет от разочарований: одна и та же модель может ощущаться и быстрой, и мучительно медленной в зависимости от того, как её запустить.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.
Арендовать VPS для Llama 3Путь 1: Ollama (самый простой)
Одна команда — и модель работает, включая OpenAI-совместимый API.
curl -fsSL https://ollama.com/install.sh | sh
ollama run llama3
Проверка через API.
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"llama3","messages":[{"role":"user","content":"Привет"}]}'
Ollama сама подбирает разумный квант, кэширует веса и даёт OpenAI-совместимый эндпоинт без единой строки конфига — это лучший вариант для старта. Нужную версию тянут по тегу: ollama pull llama3.1 или ollama pull llama3:70b. Модель остаётся в памяти между запросами, так что второй и последующие ответы приходят без задержки на загрузку.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.
Путь 2: llama.cpp с GGUF
Если нужен контроль над квантом и минимальные зависимости — бери llama.cpp и GGUF-веса.
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp && cmake -B build && cmake --build build -j
./build/bin/llama-server \
-m ./models/Meta-Llama-3-8B-Instruct.Q4_K_M.gguf \
--host 0.0.0.0 --port 8080 -c 8192
GGUF-веса для Llama 3 удобно брать у сообщества (например, репозитории с готовыми квантами) — тогда не нужно самому конвертировать оригинальные веса Meta. llama.cpp использует все ядра CPU, и флаг -t позволяет явно задать число потоков под твой процессор; на многоядерном EPYC разумно поставить его равным числу физических ядер. Флаг -c задаёт контекст: чем он больше, тем больше оперативной памяти уйдёт под кэш, так что без нужды раздувать его не стоит.
Путь 3: vLLM для скорости
На GPU vLLM даёт максимальный throughput и родной OpenAI API. Модель Meta гейтед — прими лицензию и задай токен.
export HF_TOKEN=hf_...
pip install vllm
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Meta-Llama-3-8B-Instruct \
--host 0.0.0.0 --port 8000 --max-model-len 8192
Выбор кванта
Квантование решает, влезет ли модель и насколько просядет качество.
- Q4_K_M — золотая середина, минимум потерь при вдвое меньшем весе.
- Q5_K_M / Q6_K — ближе к оригиналу, но тяжелее.
- Q8_0 — почти без потерь, но большой размер.
- AWQ/GPTQ — 4-битные форматы под GPU-инференс.
Практическое правило: начни с Q4_K_M и подними квант только если качество ответов на твоих задачах не устраивает. Разница между Q4 и Q6 на большинстве бытовых задач едва заметна, зато вес и требования к памяти отличаются существенно. На CPU меньший квант ещё и напрямую ускоряет генерацию, так что гнаться за Q8 без причины смысла нет.
Частые ошибки
- 403 на HuggingFace — не принята лицензия Meta или нет HF_TOKEN.
- Модель тормозит на CPU — возьми меньший квант и урежь контекст.
- OOM на GPU — снизь max-model-len и gpu-memory-utilization.
- Порт наружу без ключа — обязательно прикрой Nginx + api-key.
Отдельно упомяну версии: Llama 3.1 добавила очень длинный контекст и улучшенную многоязычность, а компактные 3.2-модели заточены под лёгкие устройства. Если проект чувствителен к русскому языку, протестируй именно 3.1 — она заметно ровнее держит грамматику. И не гонись за максимальным контекстом «на всякий случай»: длинное окно всегда оплачивается памятью и скоростью, поэтому ставь ровно столько, сколько реально нужно твоим запросам.
Нужен сервер под эту задачу?
Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США и РФ. Оплата картой РФ и по СБП.
Арендовать VPS для Llama 3Обсудить статью, задать вопрос или начать новую тему
Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.
Перейти в сообщество →Частые вопросы
Какую версию Llama 3 брать для старта?
8B Instruct — лучший баланс скорости и качества, работает даже без GPU в 4-битном кванте.
Нужен ли аккаунт HuggingFace?
Для официальных весов Meta — да, надо принять лицензию и использовать HF_TOKEN. В Ollama модель тянется без этого.
Пойдёт ли 70B на CPU?
Технически да с сильным квантом, но медленно. Для 70B реалистичнее GPU-конфигурация.
Нужны сами нейросети для контента?
Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.