Estado do serviço e disponibilidade Faturação apenas em criptomoeda · Registo sem KYC

Guia do operador · 4 min de leitura

Memória de servidor ECC vs não-ECC

A memória ECC deteta e corrige certos erros de memória. Decida se o seu servidor necessita dela com base nas consequências de dados corrompidos e, em seguida, verifique a plataforma completa e o seu caminho de monitorização.

O que muda o ECC

A memória com código de correção de erros armazena informações de verificação adicionais com cada palavra. O controlador de memória pode corrigir erros comuns de bit único e reportar eventos que a memória comum pode passar silenciosamente para o sistema operativo. ECC reduz uma classe de risco de corrupção de dados; não substitui somas de verificação, cópias de segurança ou validação ao nível da aplicação.

Quando ECC deve ser a predefinição

Priorize ECC para bases de dados, matrizes de armazenamento, trabalhos científicos de longa duração, clusters de virtualização e sistemas onde um valor corrompido em memória pode ser persistido ou replicado. Quanto mais tempo a máquina funcionar e mais memória tiver, mais úteis se tornam a deteção e correção como camadas num plano de fiabilidade.

Quando o não-ECC pode ser racional

Configurações não ECC podem ser consideradas para cargas de trabalho substituíveis com validação independente e reimplementação frequente. Compare o preço completo e a carga de trabalho medida com as consequências de erros de memória. Não é uma afirmação de que a memória comum nunca falha.

PerguntaECC enxutoNão-ECC pode servir
Um valor errado pode tornar-se permanente?SimNão, as saídas são verificadas de forma independente
O tempo de inatividade é caro?NormalmenteA instância é descartável
Pegada de memóriaGrande e de longa duraçãoPequeno ou de curta duração

Aprofundar

Construa uma decisão que possa verificar.

Guia mínimo 4

Classificar a consequência antes de escolher a memória

Comece pelo caminho dos dados e não pela família do processador. Pergunte se um valor incorreto em memória poderia ser gravado numa base de dados, escrito em metadados de armazenamento, assinado, replicado para outros nós ou usado para tomar uma decisão irreversível. Quanto mais durável e difícil de validar for a saída, mais forte é o caso para ECC. Um executor de compilação descartável cujos artefactos são verificados independentemente apresenta uma consequência diferente de um primário de base de dados ou de um anfitrião de armazenamento.

Disponibilidade e integridade são coisas separadas. Reiniciar um serviço sem estado pode ser barato, mas emitir silenciosamente um artefacto incorreto pode não ser. Inversamente, ECC não torna um anfitrião altamente disponível. Registe a perda de dados máxima aceitável, a interrupção e a consequência de erro não detetado como três requisitos distintos.

Classificar a consequência antes de escolher a memória
Pergunta de decisãoEvidências a recolherImplicação
O estado da memória pode tornar-se durável?Escritas, caches, índices e caminhos de assinaturaPrefira correção de erros explícita e relatórios
A saída pode ser reproduzida?Hashes independentes, reexecuções ou dados de origemNão-ECC pode ser aceitável quando a consequência é baixa
Um host é um domínio de falha?Design de réplica e restauroECC ainda precisa de redundância e recuperação
Será ECC um requisito de política?Requisito de cliente, auditoria ou softwareVerifique a configuração entregue antes de encomendar

Verifique o caminho completo da memória

ECC é uma propriedade do caminho implementado, não de um autocolante DIMM isolado. O controlador de memória do processador, a motherboard, as definições de firmware e os módulos instalados devem suportar o modo pretendido. O sistema operativo também precisa de um caminho de relatório adequado se os eventos corrigidos e não corrigidos devem chegar à monitorização. Não infira ECC a partir do nome de um processador de classe servidor, e não trate um campo de inventário genérico como prova de que a correção está ativa.

Para uma entrada de catálogo explicitamente rotulada como ECC, mantenha essa especificação com o registo da encomenda. Se a listagem indicar apenas DDR4 ou DDR5, solicite confirmação quando ECC for obrigatório. Após o aprovisionamento, inspecione as evidências de firmware e sistema operativo apropriadas à plataforma. O EDAC do Linux, quando suportado pelo hardware e pelo controlador, distingue eventos corrigidos de não corrigidos do controlador de memória; a ausência de um contador por si só não prova que nenhum evento ocorreu ou que o relatório está disponível.

Transforme eventos de memória em ações do operador

Defina a resposta antes do alerta. Capture uma linha de base após a implementação, retenha contagens de eventos corrigidos e não corrigidos e anexe a localização do anfitrião, socket ou módulo quando a plataforma a expuser. Um evento corrigido significa que o mecanismo detetou e corrigiu um erro; é uma evidência operacional útil, não uma razão para ignorar um padrão crescente ou repetido. Um evento não corrigido requer uma avaliação imediata da carga de trabalho e da integridade dos dados, mesmo que a máquina continue a funcionar.

Defina o escalonamento em torno da recorrência, concentração e consequência para a carga de trabalho em vez de publicar um limiar universal. Os fornecedores de hardware e as plataformas diferem, e um único número não pode cobrir todos. O runbook deve dizer quem drena cargas de trabalho, quando são recolhidos diagnósticos, como os dados são verificados e que evidência é necessária antes de devolver o host ao serviço.

Saiba o que ECC não cobre

ECC não substitui somas de verificação do sistema de ficheiros, validação de aplicações, réplicas ou backups versionados. Por si só, não pode corrigir um bug de software, uma escrita inválida já aceite como válida, credenciais comprometidas, eliminação, falha do controlador ou perda do chassis. Os diagnósticos de memória podem encontrar algumas falhas presentes, mas não podem certificar que uma falha futura nunca ocorrerá.

O resultado esperado deste exercício é um registo de decisão curto: classe de consequência, requisito ECC, evidência de configuração, fonte de monitorização e resposta a incidentes. Esse registo é mais útil do que uma afirmação genérica de que todas as cargas de trabalho precisam de ECC ou de que a memória não ECC é isenta de riscos.

Respostas diretas

Perguntas sobre este guia

Um erro de memória corrigido significa que o servidor tem de ser substituído?

Não automaticamente. Preserve o evento, a sua localização e o padrão de recorrência, verifique as orientações da plataforma e aplique a política de risco da carga de trabalho. Uma concentração repetida é uma evidência diferente de um relatório isolado, mas nenhum deve ser ocultado.

O software pode tornar a memória não-ECC equivalente a ECC?

As verificações de software e o trabalho reproduzível podem reduzir as consequências, mas não dão à memória comum a deteção e correção ao nível do controlador descritas por ECC. Utilize-as como controlos adicionais, não como um mecanismo idêntico.