MAATRIX / Блог / Б/у серверное железо: экономика с учётом отказов и без гарантии

Б/у серверное железо: экономика с учётом отказов и без гарантии

MAATRIX

Объявление на барахолке или у реселлера обещает Dell PowerEdge или HP ProLiant в три-пять раз дешевле нового. Соблазн понятен: та же платформа, тот же Xeon, только цена другая. Но за строкой «б/у, рабочее, состояние хорошее» обычно скрывается железо, которое уже прожило свою первую жизнь в чужом дата-центре, и её условия вы не знаете. Разберём честно, из чего складывается настоящая экономика такой покупки — не только цена на ценнике, а то, что вы платите потом.

Откуда берётся дешёвое б/у серверное железо

Основной источник вторичного рынка — плановая замена парка в дата-центрах: крупные операторы обновляют серверы циклами в 3–5 лет не потому, что железо ломается, а потому что заканчивается срок амортизации и поддержка производителя. Списанные машины уходят оптом брокерам, а те продают их поштучно или мелкими партиями. Второй источник — банкротства и переезды: компания распродаёт стойки целиком, часто без документации о наработке. Третий — восстановленное (refurbished) железо: реселлер прогоняет базовую диагностику, меняет очевидно нерабочие компоненты и продаёт с минимальной формальной гарантией на 30–90 дней.

Важно понимать: в первых двух случаях вы покупаете железо, которое уже отработало часть паспортного ресурса, причём в режиме 24/7 под нагрузкой, а не «полежало на полке». Это не значит, что оно плохое — многие компоненты рассчитаны именно на такой режим. Но это значит, что часть ресурса уже потрачена, и вы не знаете, какая часть. Продавец, как правило, тоже не может сказать точно — если только речь не идёт о честном реселлере, готовом показать SMART-логи и историю IPMI до продажи.

Что изнашивается быстрее всего: диски, блоки питания, вентиляторы

Не всё в сервере стареет одинаково. Материнская плата, процессор и модули памяти в серверном классе рассчитаны на долгую жизнь и при нормальном температурном режиме редко становятся узким местом по надёжности — если только не было перегрева или скачков питания. А вот три категории компонентов изнашиваются предсказуемо и именно они определяют, доживёт ли б/у сервер до конца вашего проекта без сюрпризов.

Жёсткие диски. У HDD износ механический: подшипник шпинделя, привод головок, поверхность пластин. Ключевой параметр — наработка часов (Power_On_Hours в SMART) и количество циклов включения-выключения. Диск, который честно отработал 4–5 лет в дата-центре, статистически ближе к концу типичного срока службы, чем к началу — вне зависимости от того, что внешне он «работает нормально». Отказ механического диска редко бывает мгновенным: обычно ему предшествует рост числа переназначенных секторов (Reallocated_Sector_Ct) и отложенных секторов (Current_Pending_Sector), но это видно только если смотреть SMART регулярно.

SSD и NAND-накопители. Здесь износ другой — по количеству циклов записи-стирания (P/E cycles). У SSD есть индикатор оставшегося ресурса (Media_Wearout_Indicator, Percent_Lifetime_Remain или Wear_Leveling_Count, в зависимости от производителя), и это единственный честный способ понять, сколько ресурса реально осталось. Проблема в том, что многие продавцы либо не предоставляют эти данные, либо сбрасывают счётчики через прошивку — что делает диск непроверяемым по факту.

Блоки питания. Серверные PSU почти всегда содержат электролитические конденсаторы, которые физически высыхают со временем — процесс ускоряется теплом, а внутри работающего 24/7 сервера тепла достаточно. Внешне блок питания может работать годами, а затем отказать резко, особенно под пиковой нагрузкой. Подробнее о том, как это выглядит на практике и почему резервный блок питания не панацея, если оба блока одного возраста и на одном вводе — в статье про резервный блок питания и отказоустойчивость.

Вентиляторы охлаждения. Подшипники вентиляторов изнашиваются, скорость вращения падает, растёт шум и вибрация, а следом — температура внутри корпуса. Это вторичный отказ: сам вентилятор редко приводит к простою напрямую, но перегрев из-за него убивает диски и SSD быстрее паспортного срока.

Итого: если из четырёх подсистем — диски, SSD, PSU, вентиляторы — хотя бы одна уже прошла значительную часть ресурса, вероятность отказа в первый год эксплуатации у вас выше, чем у нового железа. Насколько выше — зависит от конкретного экземпляра, и точную цифру вам никто честно не назовёт: у вторичного рынка просто нет статистики отказов, сопоставимой с тестами производителей.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать сервер

Гарантия: что вы теряете без неё

У нового сервера от Dell, HPE или Supermicro стандартная гарантия — 1–3 года с опциями next-business-day или даже 4-hour onsite replacement. Это готовая логистика: диск умер — приезжает точно такой же диск с прошивкой под вашу конфигурацию, часто ещё до того, как вы успели написать тикет.

На вторичном рынке эта логистика исчезает почти полностью. Заводская гарантия, как правило, либо истекла ещё у первого владельца (типичный возраст списанного дата-центрового железа — 3–5 лет, ровно на грани окончания расширенной гарантии), либо не передаётся вторичному покупателю. Реселлеры иногда предлагают собственную гарантию — но по факту это чаще DOA-гарантия (dead on arrival) на 30–90 дней: если сервер не завёлся сразу, его поменяют, но отказ диска через полгода — уже ваша забота.

Что это значит практически:

  • Замену деталей ищете сами. Особенно неприятно с проприетарными компонентами — салазками (caddy) под конкретную модель, бэкплейнами с привязкой к прошивке контроллера, фирменными райзерами. Под снятую с производства модель их приходится искать на том же вторичном рынке, с той же неопределённостью по состоянию.
  • Простой на диагностику и доставку — целиком на вас. Без SLA на замену время простоя зависит от того, как быстро вы найдёте деталь. Для теста это один день, для продакшна — счёт может пойти на часы прямых потерь.
  • Риск второго отказа при восстановлении RAID выше. Если один диск в массиве уже показывал признаки старения, велика вероятность, что соседние диски того же возраста и той же партии находятся в похожем состоянии. Ребилд RAID создаёт дополнительную нагрузку на все диски массива одновременно — и именно в этот момент чаще всего происходит второй отказ, если диски куплены б/у одной партией без ротации возрастов.

Отсутствие гарантии — это не абстрактный риск, а конкретная статья расходов, которую нужно заранее заложить в бюджет: либо деньгами на запасные части, либо временем инженера, либо тем и другим.

Как проверить состояние железа перед покупкой

Полностью устранить неопределённость нельзя, но снизить — можно, если не полениться проверить железо до оплаты, а не после доставки.

Попросите вывод smartctl до покупки. Честный продавец не откажет прислать smartctl -a по каждому диску. Смотрите на:

smartctl -a /dev/sda
  • Power_On_Hours — сколько часов диск уже отработал;
  • Reallocated_Sector_Ct и Current_Pending_Sector — признаки начавшейся деградации поверхности (для HDD);
  • UDMA_CRC_Error_Count — проблемы на шине, часто связаны с кабелем или контроллером, но стоит перепроверить;
  • для SSD — Wear_Leveling_Count, Media_Wearout_Indicator или Percent_Lifetime_Remain (название атрибута зависит от производителя).

Любой ненулевой Reallocated или Pending Sector на б/у диске — повод снизить цену в переговорах или отказаться от экземпляра. Какие показатели SMART реально предсказывают скорую смерть диска, а какие можно игнорировать — разобрано в статье про SMART-показатели, предсказывающие отказ.

Прогоните собственный тест после получения — не доверяйте только продавцовскому отчёту, он мог быть снят до того, как диск потрясли при транспортировке:

smartctl -t long /dev/sda
smartctl -a /dev/sda | grep -i "test_type\|result"

Для дисков, которые не жалко перезаписать (до того, как на них легли ваши данные), полезен деструктивный тест на запись — он находит битые сектора, которые SMART мог не показать:

badblocks -wsv /dev/sda

Проверьте память под нагрузкой — 1–2 полных прохода memtest86+, лучше 24 часа непрерывно. Нагрузите процессор и посмотрите на температуры и напряжения под пиковой нагрузкой, где чаще всего проявляется деградация блока питания и охлаждения:

stress-ng --cpu $(nproc) --timeout 1800s
ipmitool sensor list | grep -i "temp\|fan\|volt"

Загляните в System Event Log через IPMI/iDRAC/iLO. Это, пожалуй, самая недооценённая проверка — SEL хранит историю всех событий, которые видел контроллер управления: перегревы, коррекции ECC-ошибок, предиктивные отказы дисков, сбои питания за прошлые месяцы или годы работы у предыдущего владельца.

ipmitool sel list
ipmitool sel elist

Если лог полон записей о перегревах или предиктивных отказах — это красный флаг вне зависимости от того, что показывает SMART прямо сейчас.

Полная экономика: считаем не только цену покупки

Здесь и кроется главная ошибка при сравнении «б/у дешевле нового». Сравнивается цена покупки, а должна сравниваться полная стоимость владения за весь срок использования, включая вероятностную стоимость будущих отказов.

Упрощённо это выглядит так:

TCO(б/у) = Цена_покупки
         + Доставка_и_подготовка
         + P(отказ) × (Цена_запчасти + Стоимость_простоя + Время_инженера)
         − Остаточная_стоимость_при_перепродаже

TCO(новое/аренда) = Цена_покупки_или_аренды
                   + P(отказ) × (обычно покрыто гарантией/SLA поставщика)
                   + Время_инженера_на_рутинное_обслуживание

Ключевая разница не в первом слагаемом, где б/у железо действительно выигрывает — иногда в разы. Разница в том, что для нового железа с гарантией второе слагаемое (вероятностная стоимость отказа) в основном лежит на производителе или арендодателе, а для б/у — целиком на вас.

Мы намеренно не приводим здесь конкретных цифр вероятности отказа — таких данных по случайному экземпляру с вторичного рынка не существует в открытом виде, и любой, кто называет вам точный процент, скорее всего, его выдумывает. Но качественно утверждение верно: чем больше ресурса компонент уже израсходовал, тем ближе он статистически к правой, растущей части кривой интенсивности отказов (классическая «ванна» — bathtub curve), где вероятность отказа со временем растёт, а не падает.

Что стоит честно посчитать до покупки:

  • Стоимость простоя в час для вашей задачи. Для лабораторного стенда — почти ноль. Для продакшн-сервиса с клиентами — может быть кратно выше стоимости всего сервера.
  • Стоимость времени инженера на диагностику и замену — это не бесплатно, даже если инженер штатный, а не подрядчик.
  • Наличие и цену замены конкретных проприетарных компонентов — узнайте до покупки, а не после отказа.
  • Остаточную ликвидность — насколько легко вы сможете перепродать это железо через год-два, если проект закроется. У б/у оборудования остаточная стоимость падает быстрее.

Хороший ориентир — сравнить итоговую сумму не с ценой нового сервера в собственность, а с арендой сопоставленного по конфигурации выделенного сервера: там вероятностная стоимость отказов уже включена в тариф провайдера, который распределяет этот риск на весь свой парк железа. Когда покупка своего железа объективно дешевле аренды, а когда — наоборот — разобрано в статье когда дешевле купить железо, а когда арендовать, а скрытые статьи расходов на владение сервером — в материале про полную стоимость владения выделенным сервером.

Когда б/у железо оправдано, а когда — рискованная экономия

Честный вывод не «б/у железо — это плохо», а «б/у железо хорошо там, где вы можете себе позволить его отказ».

Разумные сценарии:

  • Тестовые и staging-окружения, где простой не мешает клиентам и легко переключиться на другую машину.
  • Домашние лаборатории и обучение — здесь отказ диска повод разобраться, а не катастрофа.
  • Холодный запас запчастей для уже существующего массива — например, б/у диски как резерв в RAID с избыточностью, где отказ одного уже покрыт архитектурой.
  • Короткие проекты с известным сроком жизни, заведомо короче, чем разумно ожидаемый остаток ресурса железа.
  • Задачи, которые легко перезапустить — пакетная обработка, рендеринг, обучение моделей с чекпоинтами, где потеря узла не теряет данные, а откладывает результат.

Рискованная экономия:

  • Продакшн-инфраструктура, обслуживающая клиентов, особенно без резервирования на уровне архитектуры (единственный узел без failover).
  • Платёжные и финансовые системы. Здесь отказ — это прямые финансовые потери и вопросы соответствия требованиям: многие compliance-рамки для платёжной инфраструктуры прямо предполагают предсказуемую поддержку оборудования поставщиком, а не «чиним сами, когда сломается».
  • Любая система с SLA перед вашими клиентами. Если вы обещаете аптайм, а эксплуатируете железо без гарантии — вы платите за чужой риск отказа собственной репутацией.
  • Долгосрочные проекты (от трёх лет). Б/у железо уже прошло часть жизненного цикла; растянуть его ещё на несколько лет — значит эксплуатировать компоненты именно в той части кривой отказов, где риск максимален.

Если сценарий попадает во вторую группу, разумная альтернатива — не покупка нового железа в собственность (это снова капитальные затраты и своя логистика замены), а аренда выделенного сервера с гарантией и SLA от провайдера. Тогда вероятностную стоимость отказа несёт не один ваш экземпляр железа, а пул провайдера, для которого замена диска — рутинная операция, а не форс-мажор.

Нужен сервер под эту задачу?

Разверните VPS MAATRIX за пару минут: NVMe, AMD EPYC, root-доступ, локации UK, США, Франция и РФ. Оплата картой РФ и по СБП.

Арендовать сервер

Нужны сами нейросети для контента?

Генерируйте изображения, видео и озвучку нейросетями на falapi.io — десятки моделей в одном окне. Оплата картой РФ и по СБП.

Частые вопросы

Стоит ли покупать б/у диски для хранения важных данных?

Только если они входят в массив с избыточностью (RAID с parity или зеркалом) и данные дополнительно бэкапятся в другое место. Единственный б/у диск без резервной копии — плохая идея для чего-либо важного, вне зависимости от цены.

Можно ли получить полноценную гарантию на б/у сервер?

У некоторых реселлеров есть расширенные платные гарантии на 6–12 месяцев, но это скорее исключение, чем правило, и стоит уточнять условия — часто это DOA-гарантия на первые недели, а не полноценная поддержка на весь срок.

Как понять, сколько ещё прослужит б/у блок питания?

Точно — никак: конденсаторы не показывают остаток ресурса через SMART-подобный интерфейс. Единственная разумная страховка — резервирование (redundant PSU на разных вводах питания) и мониторинг напряжений через IPMI, чтобы заметить деградацию до полного отказа.

Выгоднее ли в итоге арендовать новый сервер, чем покупать б/у?

Зависит от сценария: для тестовых задач и коротких проектов покупка б/у часто дешевле в моменте. Для продакшна с требованиями к аптайму аренда нового железа с гарантией и SLA обычно выгоднее по полной стоимости владения, даже при более высокой ежемесячной цене — потому что вероятностную стоимость отказов несёт провайдер, а не вы.

Нужно ли требовать у продавца историю обслуживания сервера?

Да, и это стоит делать всегда. Отчёт IPMI SEL, наработка часов по SMART и, если есть, дата последней плановой замены дисков — минимальный набор, без которого цена сделки по сути неизвестна: вы платите за железо, о реальном состоянии которого можете только догадываться.

Обсудить статью, задать вопрос или начать новую тему

Есть вопрос по этой статье, идея для обсуждения или просто хотите поделиться опытом? Сообщество MAATRIX ждёт. Для общения, пожалуйста, зарегистрируйтесь в нашем личном кабинете.

Перейти в сообщество →