«OCRmyPDF бесплатен, Tesseract бесплатен, а сервер за пару долларов в месяц — вообще не деньги» — с этой мысли обычно начинается решение поднять своё распознавание текста вместо оплаты облачного OCR-API постранично. Проблема в том, что «бесплатно» тут — про лицензию, а не про итоговую стоимость. Сервер, CPU-время на каждую страницу и ваше время на то, чтобы пайплайн не падал по ночам — это реальные расходы, просто не в виде счёта за подписку. Разберём честно, как посчитать стоимость одной распознанной страницы при self-hosted OCR и при каком объёме это…
Подробнее →