MAATRIX / Блог / Скачал модель с сайта Ollama — что делать дальше

Скачал модель с сайта Ollama — что делать дальше

Скачал модель с сайта Ollama — что делать дальше

MAATRIX

Вы зашли на ollama.com, увидели название модели или файл с расширением .gguf, скачали — и теперь смотрите на него и не понимаете, что делать. Это нормальная растерянность: Ollama устроена не так, как привычные программы, где вы скачиваете файл, дважды кликаете и всё работает. Разберём по шагам, что делать прямо сейчас, даже если вы никогда в жизни не открывали терминал.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →

Что получится в итоге

К концу статьи у вас будет работающая Ollama и хотя бы одна модель, с которой можно переписываться как в чате. Вы разберёте слова «веса», «7B», «квантизация», «контекст», «токен», научитесь смотреть список моделей, удалять лишние и прикидывать, что влезет в ваше железо. И увидите следующий шаг: браузерный чат вместо терминала и доступ к модели по сети и через API. Ничего необратимого тут нет — всё устанавливаемое удаляется одной командой.

Почему скачанный файл не запускается как обычная программа

Когда вы ставите браузер или игру, вы скачиваете установочный файл (.exe на Windows, .dmg на Mac), запускаете его и жмёте «Далее». Ollama работает иначе. Это не отдельная программа для каждой модели, а один универсальный «движок»: вы устанавливаете его один раз, а модели он потом сам скачивает и запускает по текстовой команде. Модель — это не «приложение», а огромный файл с числами (весами нейросети), который сам по себе ничего не делает.

Поэтому скачанный вручную .gguf двойным кликом не откроется: система не знает, что с ним делать, и в лучшем случае предложит текстовый редактор — вы увидите нечитаемую кашу из символов, и это нормально. Хорошая новость: скачивать файл модели вручную в подавляющем большинстве случаев вообще не нужно.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть Ollama

Словарь: что означают все эти слова

Именно жаргон чаще всего отпугивает новичка. Заучивать не нужно — прочитайте один раз и возвращайтесь, когда встретите незнакомое слово.

СловоЧто это на самом деле
МодельФайл с обученной нейросетью. Сам по себе не работает — его запускает движок вроде Ollama.
ВесаЧисла внутри этого файла, полученные при обучении. «Скачать модель» = «скачать веса».
Параметры, 7B / 8B / 70BСколько в модели этих чисел: 7B — семь миллиардов. Больше — умнее, но тяжелее и прожорливее.
КвантизацияСжатие весов: числа хранят грубее, чтобы модель занимала меньше места. Цена — потеря качества.
Q4_K_M, Q5_K_M, Q8Варианты сжатия; цифра — бит на число. Q4_K_M — ходовой компромисс, его Ollama ставит по умолчанию.
GGUFФормат файла квантованной модели. Такие файлы лежат на Hugging Face и внутри Ollama.
ТокенКусочек текста: примерно слово или часть слова. Модель читает и пишет токенами, а не буквами.
Контекстное окноСколько токенов модель держит «в голове»: вопрос, ответ и всю переписку. Что не влезло — забывается.
ИнференсУмное слово для «модель отвечает на запрос». Обучение — создание модели, инференс — её использование.
TemperatureРегулятор «творчества»: ниже — предсказуемее и суше, выше — разнообразнее и рискованнее.
System promptПостоянная невидимая инструкция: «отвечай по-русски», «ты помощник юриста». Задаёт характер модели.
ModelfileТекстовый файл-рецепт: из чего собрать модель, какой у неё system prompt и параметры.

Двух слов достаточно, чтобы читать любую инструкцию по Ollama: параметры и квантизация.

Что такое терминал и почему без него не обойтись

Терминал (он же «консоль», «командная строка») есть в любой системе. Вместо кликов мышкой вы печатаете команду и нажимаете Enter — компьютер выполняет её и отвечает тоже текстом. Это не хакерский инструмент, просто другой способ общаться с компьютером.

  • Windows: «Пуск», начните печатать PowerShell (или cmd), кликните по найденному приложению.
  • macOS: Cmd + Пробел, напечатайте Terminal, нажмите Enter.
  • Linux: обычно Ctrl + Alt + T; либо ищите в меню «Терминал» / «Konsole».

Откроется окно с мигающим курсором — это и есть терминал. Если Ollama ещё не установлена, сначала скачайте и установите саму программу с ollama.com (кнопка «Download»). Файл модели, который вы, возможно, уже скачали, для этого шага не нужен.

Как на самом деле устанавливаются модели в Ollama

Правильный способ — одна команда:

ollama pull llama3.1

Слово pull означает «притянуть», «скачать»: вы говорите Ollama «возьми вот эту модель из своего каталога». Она сама подключается к серверу, скачивает файл, кладёт его в нужную папку и запоминает, где он лежит. Искать файл и что-то настраивать вручную не нужно. На экране появится прогресс:

pulling manifest
pulling 8934d96d3f08... 100% |███████████████| 4.7 GB
verifying sha256 digest
writing manifest
success

Появилось success — модель установлена и готова. Если вы впервые открыли терминал, пригодится пошаговая инструкция, как поднять локальный запуск LLM через Ollama на сервере — там разобрана установка с нуля.

Где взять правильное имя модели

Самая частая ошибка новичков — подставить в ollama pull название из чужой статьи, записанное не в том формате, который знает Ollama. В ответ приходит error: model not found, и человек теряется. Правильный источник имён — страница ollama.com/library, а не поиск в Google или Яндексе. Это официальный каталог всех моделей, которые умеет ставить Ollama. Найдите нужное семейство (llama3.1, mistral, gemma2, qwen2.5), кликните по названию, выберите размер в выпадающем списке — справа будет готовая команда для копирования.

Имя устроено просто: семейство:тег. Например, llama3.1:8b — семейство llama3.1, вариант на 8 миллиардов параметров. Если тег не писать вообще, Ollama возьмёт вариант по умолчанию: обычно самый ходовой размер в квантизации Q4_K_M. Для первого знакомства это ровно то, что нужно.

Первый запуск: команда ollama run

Чтобы начать общаться с моделью, используется другая команда:

ollama run llama3.1

Откроется диалог прямо в терминале — вы увидите приглашение >>>. После него печатайте вопрос и нажимайте Enter, модель ответит здесь же. Если модель ещё не установлена, ollama run скачает её сама, так что шаг с pull можно пропустить. Выход из чата — /bye и Enter либо Ctrl + D; прервать длинный ответ, не выходя, — Ctrl + C.

Маршрут новичка: что делать в первые полчаса

Пять действий, которые закрывают почти все бытовые задачи.

1. Проверьте, что Ollama живаollama --version. Печатается номер версии — всё в порядке. «Команда не найдена» — вам в раздел про PATH ниже.

2. Посмотрите, что уже установленоollama list. Покажет имя модели, идентификатор, размер на диске и дату. Пустой список просто значит, что моделей ещё нет.

3. Запустите чатollama run llama3.1, вопрос после >>>, выход /bye.

4. Узнайте, где лежат модели. Специальной команды нет, но пути стандартные: на macOS ~/.ollama/models, на Windows C:\Users\ВашеИмя\.ollama\models, на Linux при установке официальным скриптом /usr/share/ollama/.ollama/models. Руками там ничего трогать не нужно — папка полезна, только чтобы понять, куда уходит место. Если диск мал, каталог переназначают переменной OLLAMA_MODELS.

5. Удалите то, что не пригодилосьollama rm имя-модели. Модели весят гигабайтами, и три-четыре неудачных эксперимента съедают десятки гигабайт. Команда стирает веса безвозвратно, но ничего страшного: понадобится снова — ollama pull скачает заново.

Как понять, что модель подходит вашему железу

Ответ на главный вопрос новичка механический, без магии. Чтобы модель отвечала, её веса должны целиком лежать в быстрой памяти: в видеопамяти видеокарты (VRAM) либо в оперативной памяти (RAM), если считает процессор. Отсюда арифметика: сколько модель весит на диске — примерно столько же ей нужно памяти, плюс запас на контекст и служебные буферы, который растёт вместе с длиной диалога. Правило прикидки: возьмите размер модели из ollama list, прибавьте пару гигабайт и сравните со свободной памятью — не с общим объёмом системы, а именно со свободным, за вычетом браузера и прочих программ.

Теперь понятно, почему одна и та же модель бывает в разных размерах. Измерений два: число параметров (7B, 13B, 70B) и квантизация (Q4, Q5, Q8 — сколько бит на каждое число). Модель 8B в Q4 и та же 8B в Q8 — одна и та же нейросеть, просто во втором случае веса хранятся точнее и файл крупнее. Не влезает — есть два рычага: сжатие посильнее или модель поменьше. Обычно первым дёргают квантизацию: падение качества от Q8 к Q4 для бытовых задач заметно меньше, чем разница между 8B и 13B. Подробности — квантование моделей: Q4, Q5, Q8 — что выбрать.

Если памяти не хватило, возможны три исхода. Лучший — модель не запускается и Ollama сообщает об ошибке памяти: сразу ясно, что делать. Средний — часть слоёв не влезла в видеопамять и считается на процессоре; Ollama делает так сама, работать будет, но медленнее. Худший — система уходит в своп, подкачивая недостающую память с диска: формально всё работает, фактически скорость падает драматически, потому что диск на порядки медленнее оперативной памяти. Если модель «думает» неприлично долго и слышно, как работает диск, — почти наверняка вы здесь.

Конкретные цифры зависят от процессора, объёма и типа памяти, видеокарты и её поколения, поэтому чужие замеры для вас мало что значат: ориентируйтесь на порядок величин и проверяйте на своей машине. Что ставить под ваш объём — сколько RAM нужно для Ollama: таблица моделей и какую модель Ollama поставить на 4 ГБ RAM; выбрать между процессором и видеокартой — CPU или GPU для локальной LLM.

Если вы всё же скачали GGUF-файл вручную

Бывает, что нужной модели ещё нет в каталоге ollama.com/library, зато она есть на Hugging Face в виде файла .gguf — и вы его уже скачали. Ollama умеет работать и с таким файлом, нужен один дополнительный шаг: текстовый файл-инструкция Modelfile (именно с большой буквы M, без расширения).

  1. Найдите папку со скачанным .gguf-файлом (обычно «Загрузки» / Downloads) и создайте в ней текстовый файл с именем Modelfile — без .txt на конце.
  2. Откройте его в простом редакторе (Блокнот, TextEdit в режиме обычного текста) и впишите одну строку с точным именем вашего файла: FROM ./nazvanie-vashego-fajla.gguf.
  3. В терминале перейдите в папку, где лежат оба файла. Команда перехода — cd (от «change directory»), например cd Downloads.
  4. Создайте модель: ollama create moya-model -f Modelfile. Здесь moya-model — любое имя, которое вы придумываете сами (латиницей, без пробелов).
  5. Запустите её привычной командой ollama run moya-model.

Дальше она ведёт себя как модель из pull: Ollama сама её запускает и выгружает из памяти. В Modelfile удобно сразу зашить system prompt из словаря — добавьте под строкой FROM строки SYSTEM "Всегда отвечай на русском языке." и PARAMETER temperature 0.7, и модель будет вести себя одинаково при каждом запуске.

Если терминал не находит команду ollama

Вы вроде бы установили Ollama, но на любую команду терминал отвечает ollama: command not found (Mac/Linux) или «'ollama' не является внутренней или внешней командой» (Windows). Значит, система не знает, где искать программу. Причин обычно две.

Установка не завершилась до конца. Установщик мог закрыться раньше времени. Решение — скачать файл с ollama.com заново и переустановить, дождавшись явного сообщения об успехе.

Терминал был открыт до установки. Самый частый случай: открытое окно не «узнаёт» о новой программе, потому что система обновляет список доступных команд (переменную PATH) только для новых окон. Решение — полностью закрыть терминал и открыть заново.

Если не помогло: на Windows перезагрузите компьютер целиком, а на Mac проверьте, что Ollama лежит в папке «Программы» и хотя бы раз была открыта двойным кликом — при первом запуске она донастраивает системные компоненты. Более подробный разбор сбоев — Ollama не запускается: причины и решение.

Что делать дальше, когда чат в терминале надоел

Общаться через >>> нормально ровно первые полчаса. Дальше неудобно: история не сохраняется, документ не вставить, с телефона не открыть. Решает всё одна вещь: Ollama — не только чат в терминале. После установки она поднимает локальный сервер, который слушает порт 11434 и принимает запросы по HTTP. Команда ollama run — просто один из клиентов к нему, а значит, подключиться может и любой другой.

Шаг первый: веб-интерфейс. Самый популярный — Open WebUI: страница в браузере, похожая на привычные облачные чаты, с историей переписки, переключением моделей и загрузкой файлов. Ставится в Docker одной командой и сам находит вашу Ollama:

docker run -d -p 3000:8080 \
  --add-host=host.docker.internal:host-gateway \
  -v open-webui:/app/backend/data \
  --name open-webui ghcr.io/open-webui/open-webui:main

Чат откроется по адресу http://localhost:3000. Подробная установка — как установить и настроить Open WebUI на VPS; если интерфейс поднялся, но список моделей пуст — Open WebUI не видит Ollama.

Шаг второй: доступ с других устройств. По умолчанию Ollama слушает только сама себя (127.0.0.1) — ради безопасности. Чтобы открыть доступ, задают переменную OLLAMA_HOST=0.0.0.0 и перезапускают Ollama: на Linux через службу systemd, на Windows и macOS — через переменные окружения пользователя. Важно: логина и пароля у Ollama нет, поэтому выставлять её в интернет «как есть» нельзя — ограничьте доступ файрволом, VPN или обратным прокси с авторизацией. Как сделать аккуратно — Ollama: доступ по сети и через API.

Шаг третий: свои программы через API. К модели можно обращаться из любого языка обычным HTTP-запросом:

curl http://localhost:11434/api/generate -d '{"model":"llama3.1","prompt":"Что такое DNS?","stream":false}'

В ответ придёт JSON с текстом. Отсюда до собственного бота один шаг: свой Telegram-бот на локальной модели Ollama собирается ровно на таких запросах. Есть у Ollama и режим совместимости с форматом OpenAI, так что многие готовые приложения подключаются простой заменой адреса сервера.

Именно здесь Ollama обычно переезжает с ноутбука на постоянно включённый сервер: батарея не садится, вентиляторы не шумят, чат доступен с любого устройства и не выключается, когда вы закрыли крышку. Команды ровно те же, только вводятся в терминале сервера через SSH.

Типичные грабли новичка

Медленные ответы. Скорее всего, модель не влезла в быструю память целиком и часть работы ушла на процессор или в своп. Лечится тремя способами: модель поменьше, квантизация посильнее, освободить память, закрыв браузер и прочее тяжёлое. Разбор причин — Ollama медленно генерирует токены.

Отвечает не на том языке. Многие модели обучены преимущественно на английском и сваливаются на него. Решение — попросить прямо: «отвечай на русском», а чтобы не повторять каждый раз, задайте system prompt: /set system "Всегда отвечай на русском языке" в чате или строку SYSTEM в Modelfile. Если модель упорствует — она слабо знает русский, берите ту, у которой многоязычность заявлена явно.

«Забывает» начало разговора. Это не баг, а контекстное окно: когда переписка перестаёт помещаться в отведённое число токенов, самые старые сообщения выпадают. Начинайте новый чат при смене темы или увеличьте окно параметром num_ctx — но большее окно требует больше памяти. Как это считается — контекстное окно и память: как считать.

Модели заняли весь диск. Каждая скачанная модель остаётся на диске, пока вы её не удалите: смотрите ollama list, чистите через ollama rm.

Недоступна с другого устройства. Поведение по умолчанию, а не поломка: нужен OLLAMA_HOST=0.0.0.0, перезапуск и открытый порт 11434 — обязательно вместе с ограничением доступа.

Не стартует после перезагрузки. На Windows и macOS это фоновое приложение — проверьте, что оно запущено (значок в трее или строке меню) и что включён автозапуск. На Linux она ставится службой systemd: автозапуск включается командой sudo systemctl enable --now ollama, а журнал при падении смотрят через journalctl -u ollama -e.

Симптом → причина → что делать

СимптомВероятная причинаЧто делать
command not found на любую командуТерминал открыт до установки, PATH не обновилсяЗакрыть и открыть терминал заново; на Windows — перезагрузиться
model not found при ollama pullИмя написано не в формате OllamaВзять точное имя со страницы ollama.com/library
Ответ выходит по слову, диск шуршитНе влезло в память, работа идёт через свопМодель меньше или квантизация сильнее, освободить память
Отвечает по-английскиНет system prompt, модель англоязычная/set system "Отвечай на русском" или SYSTEM в Modelfile
Забывает начало длинного диалогаПереписка вышла за контекстное окноНовый чат или увеличить num_ctx, если хватает памяти
Диск заполнился после экспериментовСкачанные модели остаются на дискеollama list, затем ollama rm для лишних
Не подключиться с телефонаOllama слушает только 127.0.0.1OLLAMA_HOST=0.0.0.0, перезапуск, открыть порт, ограничить доступ
После перезагрузки не работаетСлужба не стартовалаАвтозапуск: трей на Windows/macOS, systemctl enable --now ollama

Шпаргалка команд Ollama

ollama --version         # проверить, что Ollama установлена
ollama pull llama3.1     # скачать модель из каталога ollama.com/library
ollama run llama3.1      # запустить чат (скачает модель, если её ещё нет)
ollama list              # установленные модели и их размер на диске
ollama ps                # какие модели прямо сейчас загружены в память
ollama show llama3.1     # размер, квантизация, контекст текущей модели
ollama rm llama3.1       # удалить модель и освободить место
ollama create moya-model -f Modelfile   # собрать свою модель из GGUF-файла
curl http://localhost:11434/api/tags    # то же через API: список моделей в JSON

Команды внутри чата, после приглашения >>>:

/bye                              # выйти из чата
/clear                            # очистить контекст, начать разговор заново
/set system "Отвечай по-русски"   # постоянная инструкция модели
/set parameter temperature 0.7    # «творческость»: ниже — суше и предсказуемее
/set parameter num_ctx 8192       # размер контекстного окна в токенах
/?                                # список всех доступных команд

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Развернуть Ollama

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Частые вопросы

Нужно ли заходить на ollama.com, чтобы скачать модель?

На сайт полезно зайти за точными именами моделей в разделе Library, но сам файл через браузер скачивать не нужно — этим займётся ollama pull.

Я скачал .gguf-файл, он весит 4-5 ГБ — это нормально?

Да, обычный размер для модели среднего размера в квантованном виде. Модели крупнее весят десятки гигабайт.

Можно удалить скачанный вручную .gguf, если модель я поставил через ollama pull?

Да. После установки через pull файл из браузера Ollama не использует, он просто занимает место.

Я ввёл ollama run с неправильным именем, ничего не сломалось?

Нет. Ollama ответит ошибкой, что такой модели нет в каталоге, и ничего не установит.

Что означает Q4_K_M и нужно ли мне в это лезть?

Это способ сжатия весов, примерно четыре бита на число — ходовой компромисс между размером и качеством. Для начала лезть не нужно: Ollama по умолчанию ставит именно такой вариант.

Модель занимает 5 ГБ на диске — значит, нужно 5 ГБ памяти?

Примерно столько плюс запас на контекст и буферы, так что свободной памяти должно быть ощутимо больше размера файла. Точная величина зависит от вашего железа и длины диалогов.

Нужна ли видеокарта, чтобы начать?

Нет. Ollama работает и на процессоре, просто ответы формируются медленнее. Для знакомства и небольших моделей этого достаточно.

Можно держать несколько моделей сразу?

На диске — сколько угодно, ограничение только по месту. В память Ollama подгружает модель при обращении и выгружает после простоя; что загружено сейчас, показывает ollama ps.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →