Сообщество / Железо

сколько ram реально ест 14b с контекстом, пересчитал свои же цифры

gleb_tomsk
Junior
Сообщения: 41
Репутация: 26
Дата регистрации:
21.08.2026
АВТОР ТЕМЫ12 сент. 2026 г., 13:22 (GMT+3)
Выходной, дошли руки померить, а не прикидывать. И заодно поправить себя: на неделе я тут писал, что 14b q4 «комфортно на 16 гб» — это правда, но я забыл про контекст, а он в реальной работе съедает больше, чем кажется.
Мерил htop'ом на живой работе, cpu, без gpu, qwen2.5 14b q4, Maat Pro (16 гб):

  • модель загружена, пустой контекст: ~9 гб
  • рабочий диалог, контекст 4-8к токенов: ~11-12 гб
  • закинул большой кусок (документ на 20-30к контекста): подкрадывается к 14-15 гб, и вот тут уже начинает пыхтеть

то есть «14b влезает в 16» — да, но если ты гоняешь длинный контекст (RAG, большие промпты), запас тает. На Heka (8) 14b формально загрузится, но с любым нормальным контекстом уйдёт в своп, и это не «медленнее», это «пойду попью чай пока абзац допишется».
Вывод, который я сам себе на неделе не дописал: смотрите не на размер модели, а на размер модели + ваш контекст. Кто гоняет 14b на длинных промптах — на скольких гигах и где у вас начинается своп? Интересно, я один такой жадный до контекста?
3
masha_spb
Junior
Сообщения: 66
Репутация: 50
Дата регистрации:
11.08.2026
12 сент. 2026 г., 15:10 (GMT+3)
gleb_tomsk вот за это «пересчитал себя» тебя и читают) добавлю с другой стороны: контекст можно не раздувать. Люди суют в промпт весь документ, потому что «а вдруг». Для RAG правильно — достать 3-5 релевантных кусков и дать их, а не 30к токенов целиком. Тогда 14b на Maat Pro живёт спокойно, и качество даже лучше: модель не тонет в мусоре. Так что твой своп часто лечится не докупкой ram, а нормальной выборкой. Хотя докупить ram, конечно, приятнее, чем чинить пайплайн)
2
kirill_nsk
Junior
Сообщения: 87
Репутация: 42
Дата регистрации:
26.08.2026
12 сент. 2026 г., 16:40 (GMT+3)
gleb_tomsk я половину слов не понял, но запомнил главное: не бери 14b на восьмёрку) мне и 7b для чата хватает, я даже её редко трогаю, у меня сервер вообще ради туннеля. но читать вас интересно, как будто в другой лиге играете
0
D
dasha_voice
Junior
Сообщения: 6
Репутация: 0
Дата регистрации:
08.09.2026
12 сент. 2026 г., 17:05 (GMT+3)
gleb_tomsk а whisper тогда сколько рядом ест? я под него как раз Heka взяла по вашему совету, large-v3 в int8. Если он сам ~4-5 гб, а вы пишете, что 14b с контекстом почти всё съедает — это значит их вдвоём на восьмёрке лучше не запускать? Мне модель и не нужна одновременно с расшифровкой, но вдруг забуду и запущу))
0
gleb_tomsk
Junior
Сообщения: 41
Репутация: 26
Дата регистрации:
21.08.2026
12 сент. 2026 г., 18:20 (GMT+3)
dasha_voice ровно так: whisper large-v3 int8 это ~4-5 гб пока считает, а 14b под контекстом почти всю восьмёрку. Вдвоём разом — гарантированный своп и «оба тормозят». Но тебе их одновременно и не надо: расшифровала интервью — потом отдельно гоняешь модель по тексту. По очереди на Heka спокойно, параллельно — нет. masha_spb про выборку в точку: у меня своп чаще от того что я сам сую лишнее в контекст, чем от модели. допишу себе на лоб «не пихай весь документ».
1