Руководитель отдела из 20 человек, который решил поставить свою LLM вместо ChatGPT по подписке, обычно упирается в один и тот же вопрос: какое железо брать и сколько это будет стоить в месяц. Ответ «зависит» здесь не отговорка, а суть задачи — стоимость определяется не числом сотрудников, а пиковой одновременной нагрузкой и тем, какую модель эта нагрузка реально требует. Разберём методику расчёта по шагам: от оценки параллельности до готовой конфигурации сервера и сравнения с оплатой по токенам.
Подробнее →