Если на сервере одна видеокарта, а сервисов, которым она нужна, несколько — эмбеддинги для одного проекта, инференс LLM для другого, генерация изображений для третьего, — покупать под каждый отдельную карту обычно не нужно. Вопрос в том, как эти сервисы поделят одну и ту же GPU так, чтобы никто из них не остался без памяти и не отжал все вычисления у соседей в самый неподходящий момент. Разберём три уровня изоляции — от «пусть само разберётся» до жёсткого лимита — и как понять, кто на карте на самом деле ест ресурсы.
Подробнее →