Успішне відновлення даних

Ситуація

Реконструкція 20-дискового масиву RAID 6 з NAS у лабораторії ITHOPE Brno — клонувальна станція DeepSpar з паралельно працюючими дисками
Паралельне клонування всіх 20 дисків із enterprise-NAS — посекторне (sector-level) копіювання через DeepSpar Disk Imager.

Клієнт — середня проєктна фірма — використовує NAS із 20 дисками в RAID 6 (два диски парності, витримує одночасний відмову двох дисків) для CAD-документації, історичних проєктів і резервних копій бухгалтерії. Ємність масиву: 160 ТБ, ефективна — близько 130 ТБ. Вік масиву: 4 роки.

Що сталося:

  1. Понеділок зранку — NAS повідомляє про відмову диска #7. Адмін замовляє запасний, планує rebuild на ніч.
  2. Вівторок зранку — ще до прибуття запасного диска NAS повідомляє про відмову наступного диска #12. Масив у стані degraded-critical (нульова толерантність до подальшої втрати).
  3. Вівторок по обіді — після прибуття запасних дисків запуск rebuild. Через 30 годин rebuild завис на помилковому секторі диска #5 (той був «здоровим», але під час інтенсивного rebuild на поверхні проявилися биті сектори).
  4. Середа — NAS офлайн, масив not recoverable звичайними засобами.

Чому це довелося везти в лабораторію

Стандартний rebuild не вдався. Спроба ddrescue зайняла б тижні (копіювання цілих 20-ТБ дисків copy-on-read), і все одно нічого не гарантувала б, оскільки parity recovery довелося б знову зачіпати помилкові сектори.

Рішення: посекторне клонування всіх 20 дисків, офлайн-аналіз парності, реконструкція файлової системи.

Що ми зробили

  1. День 1–2: Прийом NAS, фотодокументація, маркування дисків за позицією. Дисків ми торкалися якомога менше.
  2. День 3–5: Клонування всіх 20 дисків через DeepSpar Disk Imager. Диск #5 і диск #7 мали пошкоджену поверхню, клонувалися кількома проходами з різною стратегією (forward, reverse, reading multiple times).
  3. День 6–7: Офлайн-аналіз парності на нашій реконструкційній станції. Визначення правильного зміщення stripe (NAS використовував пропрієтарне компонування), визначення фактичного порядку дисків.
  4. День 8–9: Віртуальна реконструкція масиву з клонів, витягування даних у staging-сховище (120 ТБ SATA RAID 10).
  5. День 10: Клієнт приїхав у філію, переглянув структуру папок і вміст. 100% цілісність, жодної помилки в ключових CAD-файлах.
  6. День 11: Передача даних на нові enterprise-диски, які приніс клієнт. Disk wipe на нашому staging-сховищі. Клієнт поїхав з повним NAS, старий NAS вивів з експлуатації.

Результат

  • 100 % даних відновлено (клієнт перевірив випадково обрані CAD-проєкти за 2020, 2022, 2024 — усе відкрилося без пошкоджень)
  • 11 днів лабораторної роботи
  • 0 днів клієнт без доступу до даних — у перші 3 дні ми з клонованих ділянок витягли актуальні проєкти пріоритету A як quick-win

Висновки для клієнта

  • RAID 6 — це не резервна копія. Це захист від відмови диска, а не від відмови масиву.
  • Rebuild — небезпечний момент. Інтенсивне читання всієї поверхні в дисків, яким 3–4 роки, виявляє биті сектори.
  • Регулярний scrub (Synology, QNAP, ZFS) виявляє биті сектори ще до того, як дійде до збою rebuild.
  • Offsite backup — необхідність. Сьогодні клієнт має Veeam backup на нашій інфраструктурі + ротовані USB-диски.

Маєте схожий випадок? Запит на відновлення даних RAID/NAS · +420 775 556 063