Estado del servicio y disponibilidad Facturación solo con criptomonedas · Registro sin KYC

Guía del operador · 4 min de lectura

¿Qué nivel de RAID para un servidor?

Elija un nivel RAID según el número de unidades, la capacidad utilizable, la carga de trabajo y los fallos tolerados. La disposición también debe ajustarse a su plan de monitoreo y restauración: la redundancia dentro de un servidor no es una copia de seguridad.

Comience con el modelo de fallos

RAID cambia la disponibilidad y la capacidad utilizable; no es una copia de seguridad. Decida cuántos fallos simultáneos de unidades debe tolerar el array, cuánto importa el rendimiento de escritura y cuánto tiempo puede durar una reconstrucción antes de seleccionar un nivel.

NivelCapacidad utilizable con N unidades iguales de tamaño SCompensación típica
RAID 0N × SSin redundancia
RAID 1SEspejo simple
RAID 5(N − 1) × SUna unidad de paridad; penalización de escritura
RAID 6(N − 2) × STolerancia a dos unidades
RAID 10(N ÷ 2) × SPares en espejo y E/S aleatoria intensa

El riesgo de reconstrucción importa

Los arreglos HDD grandes pueden reconstruirse durante muchas horas. Durante ese intervalo, cada dispositivo restante está ocupado, lo que aumenta la exposición a un segundo fallo y errores de lectura latentes. RAID 6 suele ser una disposición de capacidad conservadora para grandes conjuntos de copias de seguridad; RAID 10 se elige a menudo para bases de datos con escritura intensiva. Valide contra el controlador, el sistema de archivos y el objetivo de recuperación.

Mantenga una copia independiente

Una matriz no puede proteger contra la eliminación, el ransomware, la corrupción del sistema de archivos, los errores del controlador o un evento a nivel de sitio. Mantenga datos de respaldo versionados en otro dominio de fallos y pruebe las restauraciones.

Profundizar

Construya una decisión que pueda verificar.

Guía mínima de 4

Escribe primero el requisito de recuperación

Defina el modelo de fallos en lenguaje sencillo: un dispositivo, dos dispositivos, una controladora, borrado accidental o todo el servidor. RAID solo aborda algunos fallos de dispositivos. Establezca un objetivo de tiempo de recuperación para la restauración del servicio y un objetivo de punto de recuperación para la pérdida de datos, y luego identifique qué requisito puede satisfacer la matriz local y cuál requiere replicación o copia de seguridad en otro lugar.

Registre también si el sistema debe seguir aceptando escrituras mientras esté degradado. Un archivo de solo lectura, una base de datos con muchas escrituras y espacio temporal desechable pueden usar el mismo número de discos pero necesitar diseños diferentes. La eficiencia de capacidad es, por tanto, una restricción, no el veredicto.

Haga coincidir el diseño con la carga de trabajo y el número de dispositivos

Los espejos son sencillos para un conjunto de arranque o datos de dos dispositivos y pueden adaptarse a E/S aleatorias donde los grupos espejados independientes son útiles. Los diseños de paridad intercambian trabajo de escritura y complejidad de reconstrucción por más capacidad. La paridad doble puede preservar un margen adicional de fallo en un conjunto HDD amplio, mientras que RAID 10 intercambia la mitad de la capacidad bruta por pares espejados. Estas son tendencias de diseño, no garantías de rendimiento; el controlador, el sistema de archivos, la profundidad de cola, el tamaño de registro y el patrón de la aplicación importan.

Utilice la topología real del catálogo. Los servidores de almacenamiento con 12 discos y 24 discos permiten opciones no disponibles en un servidor de cómputo con dos NVMe. No incluya el par de arranque NVMe separado en el cálculo del conjunto de datos y no asuma que un grupo muy amplio es preferible a varios grupos sin modelar los dominios de fallo y el comportamiento de E/S.

Haga coincidir el diseño con la carga de trabajo y el número de dispositivos
Pregunta sobre la carga de trabajoDiseño a evaluarMotivo para validar
Se requieren dos dispositivos locales y continuidadEspejoCapacidad de un dispositivo y un estado degradado simple
Amplio grupo de HDD con requisito de doble falloRAID 6 o RAIDZ2Ancho de paridad, carga de reconstrucción y guía del sistema de archivos
Escrituras aleatorias y múltiples pares de unidades paresRAID 10 o vdevs en espejoCompensación de capacidad y latencia de carga de trabajo real
Datos desechables con una fuente reproducibleRAID 0 puede considerarseLa pérdida de cualquier miembro pierde el array

Elija una capa para poseer la redundancia

Decida si un controlador de hardware, Linux MD o un sistema de archivos como ZFS es el propietario del diseño. Evite apilar capas RAID independientes sin una razón documentada porque el estado de salud y reemplazo puede volverse ambiguo. La redundancia ZFS se expresa mediante espejos o vdevs RAIDZ y depende de sumas de comprobación; un vdev de nivel superior perdido puede perder el pool, por lo que agregar un dispositivo no redundante solitario a un pool que de otro modo sería redundante cambia el modelo de fallos.

Confirme la identidad de la unidad, el procedimiento de reemplazo, el comportamiento de arranque y lo que el sistema operativo puede observar antes de crear el arreglo. Cambiar la topología más adelante puede ser limitado o disruptivo, particularmente para diseños de paridad.

Planifique la ventana degradada y de reconstrucción

La supervisión debe distinguir los estados saludable, degradado, de reconstrucción y de comprobación de consistencia. Linux MD expone acciones como resync, recover, check y repair; recopile el progreso y las discrepancias en lugar de informar solo de que el volumen está montado. Un RAID 5 o 6 sucio y degradado puede presentar un riesgo de corrupción, por lo que el ensamblaje forzado nunca debe ser un atajo rutinario de recuperación.

Documenta el enrutamiento de alertas, la adquisición de repuestos, la identificación de reemplazos, la limitación de la carga de trabajo y el punto en el que una restauración es más segura que continuar. Nunca prometas una duración de reconstrucción sin medir los dispositivos entregados, la carga del array y el controlador.

Registre la elección y sus límites

El diseño completado debe nombrar el diseño, las suposiciones de discos iguales, la estimación de capacidad utilizable, los fallos tolerados, la fuente de supervisión y la ubicación de restauración. Mantenga los datos versionados en otro dominio de fallos y pruebe una restauración. El resultado esperado no es una afirmación de que RAID evita la pérdida; es un conjunto cuyo comportamiento ante fallos y responsabilidad de recuperación se comprenden antes de que lleguen los datos de producción.

Respuestas directas

Preguntas sobre esta guía

¿Es RAID 6 siempre la mejor opción para un servidor HDD grande?

No. Ofrece tolerancia de doble paridad, pero el I/O de la carga de trabajo, el ancho de vdev o matriz, la guía del controlador o sistema de archivos, las operaciones de reconstrucción y el objetivo de recuperación aún determinan el diseño.

¿Puede un repuesto en caliente sustituir a una copia de seguridad externa?

No. Un repuesto puede acortar el tiempo antes de que comience la reconstrucción, pero permanece en el mismo servidor y no protege contra el borrado, el compromiso, la corrupción propagada a través de la pila o la pérdida del sitio.