Indicatori chiave di prestazione per il disaster recovery: misuri RTO, RPO, preparazione e ripristino degli asset

Una strategia di disaster recovery si concentra sul ripristino di sistemi e infrastrutture critiche dopo un’interruzione. In questo articolo, esploreremo come misurare la preparazione di specifici sistemi o asset per il disaster recovery e calcolare la prontezza complessiva del disaster recovery aggregando i dati dagli asset individuali.

3 passaggi per implementare una strategia di disaster recovery di BSC Designer

Oltre il disaster recovery per l’IT

Con una media di 4,2 interruzioni legate ai dati all’anno1, vediamo una tendenza crescente a potenziare il disaster recovery IT e ad allinearlo con la funzione complessiva di GRC.

Allo stesso tempo, un numero crescente di eventi dirompenti, specialmente condizioni meteorologiche estreme, spinge le organizzazioni a guardare oltre la continuità operativa di base e a considerare un ambito più ampio2 di disaster recovery, includendo il recupero dell’infrastruttura, il recupero delle strutture, il recupero operativo e altro ancora.

L’approccio all’implementazione della strategia, basato su una strategia allineata e scorecard funzionali, consente alle organizzazioni di adattare i principi di uno scorecard di disaster recovery IT a questo ambito più ampio e di integrarlo nella strategia complessiva dell’azienda.

Passaggio 1. Analisi dell’impatto aziendale e dei rischi

Inizia la progettazione di uno scorecard per il recupero in caso di disastro con alcune analisi e fasi di pianificazione3:

  • Analisi dell’impatto aziendale per identificare le risorse critiche
  • Analisi dei rischi per identificare i potenziali effetti dell’incertezza sull’azienda
  • Pianificazione degli scenari per esplorare come i rischi identificati potrebbero influenzare le risorse critiche

A seconda della complessità dei sistemi e delle parti interessate coinvolte, il processo di analisi può essere formalizzato utilizzando scorecard funzionali. Ad esempio:

Passo 2. Stabilire gli obiettivi di punto di recupero e tempo di recupero

In questo passo, stabiliamo:

  • Obiettivo di punto di recupero (perdita accettabile, come la perdita di dati accettabile), e
  • Obiettivo di tempo di recupero (tempo di inattività operativo accettabile).

Per i calcoli dello scorecard, definiremo prima le metriche per un sistema o un bene specifico e poi le combineremo in un punteggio complessivo di conformità.

Indicatori chiave di prestazione del disaster recovery per un sistema specifico

Quando si concentra sul disaster recovery nell’IT, le organizzazioni possono monitorare metriche come l’affidabilità, il tempo di recupero e il punto di recupero per valutare e migliorare le loro strategie.

Metriche di affidabilità

  • Tempo medio tra i guasti (MTBF): Tempo tra i guasti riparabili del sistema.
  • Tempo medio al guasto (MTTF): Tempo tra i guasti non riparabili del sistema, come la durata totale di vita di un sistema.

Metriche del tempo di recupero

  • Tempo medio di recupero (MTTR)
  • Obiettivo del tempo di recupero (RTO): Tempo massimo di inattività consentito dopo un’interruzione o il MTTR target.

Un esempio della metrica del tempo medio di recupero (MTTR) con l'obiettivo del tempo di recupero (RTO) come target."

Un esempio della metrica del tempo medio di recupero (MTTR) con l'obiettivo del tempo di recupero (RTO) come target. Fonte: Visualizza Modello di scorecard per il disaster recovery online in BSC Designer Modello di scorecard per il disaster recovery.

Metriche del punto di ripristino

  • Frequenza effettiva del backup
  • Obiettivo del punto di ripristino (RPO): Tempo massimo accettabile di perdita di dati o obiettivo per la frequenza del backup.

Calcolare la performance: lineare vs. binario

Ci sono due approcci popolari per calcolare la performance dei metriche di recupero da disastri:

  • Funzione di ottimizzazione lineare
  • Funzione di ottimizzazione binaria

Ad esempio, i metriche di affidabilità nel nostro modello sono configurate come funzioni di ottimizzazione lineare. Ciò significa che la performance migliora gradualmente man mano che il valore del metrica aumenta dalla linea di base verso l’obiettivo.

Esempio

Il MTBF per un sistema di Gestione delle Relazioni con i Clienti (CRM) ha un obiettivo di 10.000 ore, con un valore effettivo di 8.000 ore.

Il Tempo Medio tra i Guasti (MTBF) è calcolato utilizzando una funzione di performance lineare.

Il Tempo Medio tra i Guasti (MTBF) è calcolato utilizzando una funzione di performance lineare. Fonte: Visualizza Modello di Scorecard per il Disaster Recovery online in BSC Designer Modello di Scorecard per il Disaster Recovery.

  • Utilizzando una funzione lineare, la performance è calcolata come 80% (= 8.000 / 10.000).
  • Utilizzando una funzione binaria, la performance è 0% perché l’obiettivo di 10.000 ore non è stato raggiunto.

Una funzione di performance binaria è utilizzata per la metrica del Tempo Medio di Recupero (MTTR).

Una funzione di performance binaria è utilizzata per la metrica del Tempo Medio di Recupero (MTTR). Fonte: Visualizza Modello di Scorecard per il Disaster Recovery online in BSC Designer Modello di Scorecard per il Disaster Recovery.

Le funzioni di performance binarie sono spesso utilizzate per il MTTR:

  • Se il MTTR è minore o uguale al RTO, la performance è 100%.
  • Se il MTTR supera il RTO, la performance è 0%.

Recovery time objective come indicatore separato

MTTR ha un valore attuale e un valore target. Il valore target corrisponde all’indicatore attuale “Recovery Time Objective (RTO)”.

Sebbene sia possibile rimuovere l’indicatore RTO e impostare direttamente il target per MTTR, i requisiti di conformità e di reporting spesso richiedono di tracciarli separatamente. Pertanto, l’RTO viene mantenuto come indicatore distinto.

Definizioni del rischio

Formulare una strategia di disaster recovery inizia con un’analisi dell’impatto aziendale e un’analisi del rischio. Alcuni rischi sono registrati in un registro centrale dei rischi, mentre rischi più specifici possono essere collegati allo scorecard di disaster recovery per singoli beni.

Un esempio di definizione del rischio per un bene.

Un esempio di definizione del rischio per un bene. Fonte: Visualizza Modello di scorecard per il disaster recovery online in BSC Designer Modello di scorecard per il disaster recovery.

La chiave è garantire una chiara connessione tra i risultati dell’analisi dell’impatto o del rischio e le metriche di recupero per specifici sistemi aziendali. Ad esempio, per i beni Server Web, i rischi di “Vulnerabilità sfruttate” e “Attacchi DDoS” sono stati definiti localmente.

Monitoraggio continuo della strategia di disaster recovery

Le metriche di disaster recovery si evolvono nel tempo:

  • I target possono essere adeguati in base ai modelli di rischio aggiornati.
  • I dati effettivi vengono aggiornati con i dati sulle prestazioni storiche.

Considerazioni chiave includono:

  • La frequenza degli aggiornamenti o delle revisioni delle metriche.
  • Gestione dei periodi senza dati, ad esempio, se ereditare i dati o visualizzare solo i dati inseriti esplicitamente.

Implementazione tramite sincronizzazione da modello

Per facilitare l’implementazione delle metriche e dei controlli di disaster recovery, considera l’utilizzo della funzione di sincronizzazione da modello:

  1. Creare un set di metriche modello per valutare un asset.
  2. Creare repliche che saranno sincronizzate dal modello.

Scopri di più sulla funzione di sincronizzazione.

Calcolo della conformità complessiva

Per valutare la prontezza complessiva, combiniamo le prestazioni dei singoli asset. Se necessario, possono essere applicati pesi per riflettere l’importanza relativa di ciascun asset.

In alternativa, la conformità complessiva può essere calcolata utilizzando l’approccio del percorso critico, concentrandosi sulle prestazioni dei sistemi critici.

Ad esempio, nel nostro modello:

  • Conformità RPO (Percorso Critico) include asset con obiettivi di punto di ripristino (RPO) di 24 e 12 ore. L’RPO complessivo è il minimo di questi valori, cioè 12 ore.
  • Se anche un solo asset non riesce a soddisfare il suo RPO (ad esempio, “RPO per la gestione dell’inventario”), l’RPO complessivo non è raggiunto.

Le scorecard totali per le metriche di tempo di recupero e punto di recupero possono essere utilizzate come fonte di dati per lo scorecard di conformità e altre scorecard funzionali legate al GRC.

Dashboard per la preparazione al disaster recovery

I principali indicatori della scorecard per il disaster recovery possono essere visualizzati su un dashboard insieme a diagrammi di rischio e iniziative di miglioramento.

Un esempio di dashboard per il disaster recovery.

Un esempio di dashboard per il disaster recovery. Fonte: Visualizza Template della scorecard per il disaster recovery online in BSC Designer Template della scorecard per il disaster recovery.

Una mappa strategica fornisce una visione chiara dei sistemi specifici e delle loro prestazioni aggregate, offrendo una panoramica completa.

Un esempio di mappa per il disaster recovery.

Un esempio di mappa per il disaster recovery. Fonte: Visualizza Template della scorecard per il disaster recovery online in BSC Designer Template della scorecard per il disaster recovery.

Passaggio 3. Stabilire controlli interni per il recupero da disastri

La definizione delle metriche di recupero da disastri (Passaggio 2) consente all’organizzazione di stabilire livelli accettabili di perdita e recupero, oltre a quantificare la sua prontezza per eventi dirompenti. Tuttavia, queste metriche non includono piani di emergenza specifici, mappature delle responsabilità4, o procedure di validazione e test. Per affrontare questo, è necessario progettare adeguati controlli interni.

In articoli precedenti, abbiamo discusso l’approccio generale per impostare controlli interni, nonché la loro applicazione pratica nel dominio della continuità operativa.

Nel contesto del recupero da disastri, la maggior parte dei

Stakeholder e Proprietari

Coinvolgere i principali stakeholder è fondamentale per il successo di una strategia di recupero in caso di disastro 4. A livello pratico, la responsabilità può essere migliorata assegnando dei proprietari alle metriche e alle iniziative di recupero in caso di disastro.

Conclusioni

Lo scorecard per il disaster recovery IT combina vari approcci alla misurazione delle prestazioni.

Quando quantifichiamo asset o sistemi specifici, ci basiamo su:

  • Mean Time Between Failures (MTBF) e Mean Time to Failure (MTTF) per stimare l’affidabilità.
  • Recovery Time Objective (RTO), che stabilisce l’obiettivo per il Mean Time to Recovery (MTTR).
  • Recovery Point Objective (RPO), che stabilisce l’obiettivo per la Frequenza di Backup.

Le prestazioni di queste metriche sono tipicamente calcolate come una funzione binaria, dove le prestazioni sono al 0% fino a quando il valore reale non soddisfa l’obiettivo di recupero.

Le metriche di recupero per singoli asset o sistemi possono essere combinate (ad esempio, utilizzando l’approccio del percorso critico) per calcolare il punteggio complessivo di prontezza o conformità.

Usa il modello Disaster Recovery

BSC Designer aiuta le organizzazioni a implementare le loro strategie complesse:

  1. Iscriviti per un piano gratuito sulla piattaforma.
  2. Usa il modello Scorecard Template Disaster Recovery come punto di partenza. Lo troverai in Nuovo > Nuova Scorecard > Altri Modelli.
  3. Segui il nostro Sistema di Implementazione della Strategia per allineare stakeholder e ambizioni strategiche in una strategia completa.

Inizia oggi e scopri come BSC Designer può semplificare l'implementazione della tua strategia!

Cita questo articolo in questo modo: Alexis Savkín, "Indicatori chiave di prestazione per il disaster recovery: misuri RTO, RPO, preparazione e ripristino degli asset," BSC Designer, Dicembre 9, 2024, https://bscdesigner.com/it/recupero-da-disastro.htm.

Lascia un commento

Questo sito utilizza Akismet per ridurre lo spam. Scopri come vengono elaborati i dati derivati dai commenti.