| gleb_tomsk |
| Junior |
Сообщения: 41 |
Репутация: 26 |
| Дата регистрации: |
| 21.08.2026 |
АВТОР ТЕМЫ12 сент. 2026 г., 13:22 (GMT+3)
Выходной, дошли руки померить, а не прикидывать. И заодно поправить себя: на неделе я тут писал, что 14b q4 «комфортно на 16 гб» — это правда, но я забыл про контекст, а он в реальной работе съедает больше, чем кажется.
Мерил htop'ом на живой работе, cpu, без gpu, qwen2.5 14b q4, Maat Pro (16 гб):
то есть «14b влезает в 16» — да, но если ты гоняешь длинный контекст (RAG, большие промпты), запас тает. На Heka (8) 14b формально загрузится, но с любым нормальным контекстом уйдёт в своп, и это не «медленнее», это «пойду попью чай пока абзац допишется».
Вывод, который я сам себе на неделе не дописал: смотрите не на размер модели, а на размер модели + ваш контекст. Кто гоняет 14b на длинных промптах — на скольких гигах и где у вас начинается своп? Интересно, я один такой жадный до контекста?
Мерил htop'ом на живой работе, cpu, без gpu, qwen2.5 14b q4, Maat Pro (16 гб):
- модель загружена, пустой контекст: ~9 гб
- рабочий диалог, контекст 4-8к токенов: ~11-12 гб
- закинул большой кусок (документ на 20-30к контекста): подкрадывается к 14-15 гб, и вот тут уже начинает пыхтеть
то есть «14b влезает в 16» — да, но если ты гоняешь длинный контекст (RAG, большие промпты), запас тает. На Heka (8) 14b формально загрузится, но с любым нормальным контекстом уйдёт в своп, и это не «медленнее», это «пойду попью чай пока абзац допишется».
Вывод, который я сам себе на неделе не дописал: смотрите не на размер модели, а на размер модели + ваш контекст. Кто гоняет 14b на длинных промптах — на скольких гигах и где у вас начинается своп? Интересно, я один такой жадный до контекста?
3