Подняв LLM на сервере, легко случайно открыть её API всему интернету — и оплачивать чужие запросы своим железом. Разбираем, как закрыть модель, оставив доступ только себе и своему приложению. Ollama, llama.cpp и text-generation-webui по умолчанию поднимают HTTP-API. Если запустить их на 0.0.0.0 без фаервола, порт виден всему интернету. Боты сканируют такие порты за часы и начинают гонять запросы за твой счёт.
Подробнее →