| gleb_tomsk |
| Junior |
Сообщения: 20 |
Репутация: 4 |
| Дата регистрации: |
| 21.08.2026 |
Сервер на maatrix, локация UK. Начинал с heka — 4 ядра, 8 гиг ram. Модель докачалась за минут десять, на диск встала без вопросов. Поднял процесс, чат как будто живой, а короткий вопрос думал секунд сорок–шестьдесят. Смотрю htop: оперативка в потолок, пошёл swap. Формально «работает». Пользоваться так нельзя — это уже не чат, а переписка с будущим.
Перенёс на maat pro, 16 гиг. Та же модель, тот же промпт — короткие ответы секунд за пять–семь, длинные уже не минута)) Для себя зафиксировал вот так, контекст средний, без 32k окон:
- 3–7b q4: живых 6–8 гб. Heka — впритык, если рядом ещё open webui и система. Браузер и зоопарк контейнеров лучше не держать: процесс не умрёт, ты будешь ждать.
- 14b q4: комфорт от 16 гб. На восьми будет swap и боль. «Процесс живой» не значит «можно сидеть и писать».
- 32b q4: от 32 гб, и то без запаса на длинный контекст. Это уже djed. На heka даже из спортивного интереса не стоит: файл скачается, фраза будет уходить минуту. Вчера зря пугал словом «никак» — формально скачается, просто незачем.
- sd / sdxl с cpu vps я не советую. Это другая песня и по памяти, и по времени. Не мерил — врать не буду.
Косяк вчерашней прикидки простой, и я на нём уже не первый раз: смотрел на размер файла модели и забывал про kv-кэш и обвязку. Файл 14b q4 весит примерно как вся оперативка heka, и кажется — вот оно, влезло. Потом поверх садится система, вебморда, кэш контекста, и если на том же ящике ещё эмбеддинги — ты уже живёшь в swap. Ollama к этому ещё свой оверхед добавляет, llama.cpp чуть скромнее, но гигабайты от этого не появляются.
С Hetzner когда-то гонял похожее. Карта из Томска там каждый раз лотерея, закрывающих не дождёшься. Тут сел и поехал, без этой карусели.
Цифры завтра могу сам поправить, уже было, не впервой. Таблицы токенов в секунду на все кванты у меня нет — только htop и ощущение «отвечает / не отвечает». Кто реально держит 14b на восьми гигах и смотрит живой htop, не калькулятор — напишите, куда уезжает память. Модель, контекст или обвязка? Интересно, насколько я жесток в «на восьми не надо». А у кого на шестнадцати уже упирается — хватает на чат или смотрите в сторону 32?