01
Najpierw zapisz wymaganie odzyskiwania
Zdefiniuj model awarii prostym językiem: jedno urządzenie, dwa urządzenia, kontroler, przypadkowe usunięcie lub cały serwer. RAID dotyczy tylko niektórych awarii urządzeń. Ustal cel czasu odzyskiwania dla przywrócenia usługi i cel punktu odzyskiwania dla utraty danych, a następnie określ, które wymaganie może spełnić lokalna macierz, a które wymaga replikacji lub kopii zapasowej gdzie indziej.
Zapisz również, czy system musi nadal przyjmować zapisy w stanie zdegradowanym. Archiwum głównie do odczytu, baza danych z intensywnym zapisem i jednorazowa przestrzeń robocza mogą używać tej samej liczby dysków, ale potrzebują różnych układów. Wydajność pojemnościowa jest zatem jednym z ograniczeń, a nie ostatecznym werdyktem.
02
Dopasuj układ do obciążenia i liczby urządzeń
Lustra są proste w przypadku dwu-urządzeniowego rozruchu lub zestawu danych i mogą pasować do losowych operacji we/wy, gdzie niezależne grupy lustrzane są przydatne. Układy parzystości wymieniają pracę zapisu i złożoność odbudowy na większą pojemność. Podwójna parzystość może zachować dodatkowy margines awarii w szerokim zestawie HDD, podczas gdy RAID 10 wymienia połowę surowej pojemności na pary lustrzane. To tendencje projektowe, a nie gwarancje wydajności; kontroler, system plików, głębokość kolejki, rozmiar rekordu i wzorzec aplikacji mają znaczenie.
Użyj rzeczywistej topologii katalogu. Serwery pamięci masowej z dyskami 12 i 24 oferują wybory niedostępne na serwerze obliczeniowym z dwoma NVMe. Nie dołączaj oddzielnej pary rozruchowej NVMe do obliczeń macierzy danych i nie zakładaj, że jedna bardzo szeroka grupa jest lepsza od kilku grup bez modelowania domen awarii i zachowania we/wy.
Dopasuj układ do obciążenia i liczby urządzeń| Pytanie o obciążenie | Układ do oceny | Powód do weryfikacji |
|---|
| Wymagane dwa urządzenia lokalne i ciągłość | Lustro | Pojemność jednego urządzenia i prosty stan zdegradowany |
|---|
| Szeroka pula HDD z wymogiem dwóch awarii | RAID 6 lub RAIDZ2 | Szerokość parzystości, obciążenie odbudowy i wytyczne systemu plików |
|---|
| Losowe zapisy i wiele parzystych par dysków | RAID 10 lub lustrzane vdev | Kompromis pojemności i rzeczywiste opóźnienia obciążenia |
|---|
| Dane jednorazowe z odtwarzalnym źródłem | RAID 0 może być rozważany | Utrata dowolnego członka powoduje utratę macierzy |
|---|
03
Wybierz jedną warstwę do zarządzania redundancją
Zdecyduj, czy kontroler sprzętowy, Linux MD czy system plików taki jak ZFS zarządza układem. Unikaj nakładania niezależnych warstw RAID bez udokumentowanego powodu, ponieważ stan zdrowia i wymiany może stać się niejednoznaczny. Nadmiarowość ZFS jest wyrażana przez lustra lub vdev RAIDZ i opiera się na sumach kontrolnych; utrata vdev najwyższego poziomu może spowodować utratę puli, więc dodanie pojedynczego nienadmiarowego urządzenia do puli inaczej nadmiarowej zmienia model awarii.
Potwierdź tożsamość dysku, procedurę wymiany, zachowanie rozruchowe i to, co system operacyjny może obserwować przed utworzeniem macierzy. Późniejsza zmiana topologii może być ograniczona lub zakłócająca, szczególnie w przypadku układów z parzystością.
04
Zaplanuj okno degradacji i odbudowy
Monitorowanie musi rozróżniać stany: zdrowy, zdegradowany, odbudowa i sprawdzanie spójności. Linux MD udostępnia akcje takie jak resync, recover, check i repair; zbieraj postęp i niezgodności, zamiast raportować tylko, że wolumin jest zamontowany. Zabrudzony i zdegradowany RAID 5 lub 6 może stwarzać ryzyko uszkodzenia, dlatego wymuszony montaż nigdy nie może być rutynowym skrótem odzyskiwania.
Udokumentuj trasowanie alertów, pozyskiwanie części zamiennych, identyfikację wymiany, ograniczanie obciążenia oraz punkt, w którym przywrócenie jest bezpieczniejsze niż kontynuowanie. Nigdy nie obiecuj czasu odbudowy bez pomiaru dostarczonych urządzeń, obciążenia macierzy i kontrolera.
05
Zapisz wybór i jego ograniczenia
Ukończony projekt powinien nazywać układ, założenia równych dysków, szacunek użytecznej pojemności, tolerowane awarie, źródło monitorowania i lokalizację przywracania. Przechowuj dane wersjonowane w innej domenie awarii i przetestuj przywracanie. Oczekiwany wynik nie jest twierdzeniem, że RAID zapobiega utracie; to macierz, której zachowanie w przypadku awarii i odpowiedzialność za odzyskiwanie są zrozumiałe przed pojawieniem się danych produkcyjnych.
Bezpośrednie odpowiedzi
Pytania dotyczące tego przewodnika
Czy RAID 6 zawsze jest najlepszym wyborem dla dużego serwera HDD?
Nie. Oferuje tolerancję dwóch parzystości, ale I/O obciążenia, szerokość vdev lub macierzy, wytyczne kontrolera lub systemu plików, operacje przebudowy i cel odzyskiwania nadal determinują układ.
Czy zapasowy dysk może zastąpić kopię zapasową zewnętrzną?
Nie. Zapasowy dysk może skrócić czas do rozpoczęcia odbudowy, ale pozostaje w tym samym serwerze i nie chroni przed usunięciem, kompromitacją, uszkodzeniem propagowanym przez stos ani utratą lokalizacji.