eviden-logo

Evidian > Produits > Logiciel de haute disponibilité - Zéro surcoût matériel > Haute disponibilité et reprise après sinistre en même temps (HADR)

Haute disponibilité et reprise après sinistre en même temps (HADR)

Evidian SafeKit

Quand combiner haute disponibilité et reprise après sinistre (HADR) ?

Architecture HADR avec un réseau rapide

Architecture combinant haute disponibilité et reprise après sinistre (HADR)

2 nœuds sont placés dans 2 sites distants pour mettre en œuvre à la fois la haute disponibilité et la reprise après sinistre (HADR).

Solution HADR avec un réseau rapide

Une solution sans partage de disque (comme SafeKit) est nécessaire avec 2 nœuds répliquant des données de manière synchrone et en temps réel.

Comme il n'y a pas de perte de données avec une réplication synchrone, un basculement automatique de l'application peut être mis en place en cas de panne.

Pourquoi un LAN/VLAN étendu ?

Quand NE PAS combiner haute disponibilité et reprise après sinistre (HADR) ?

Architecture HADR avec un réseau lent

 Architecture où la haute disponibilité et la reprise après sinistre (HADR) ne sont PAS combinées

2 nœuds sont placés dans le premier site pour une haute disponibilité et une solution de sauvegarde est mise en place pour la reprise après sinistre.

Solution HADR avec un réseau lent

Une solution de haute disponibilité (type SafeKit) est mise en place sur le premier site avec réplication temps réel synchrone et basculement automatique.

Et une solution de sauvegarde est mise en œuvre pour la réplication asynchrone via le réseau lent vers le site de reprise après sinistre.

Basculement vers le site de reprise après sinistre

  • Comme il y a perte de données avec une solution de sauvegarde, le basculement est manuel et décidé par un administrateur.
  • Les sauvegardes sont restaurées sur les serveurs du site de reprise après sinistre. Aujourd'hui, des sauvegardes de machines virtuelles sont souvent implémentées pour faciliter cette restauration (comme Veeam).
  • Le reroutage vers le site de reprise après sinistre est effectué au niveau du DNS. Le temps de reroutage dépend du délai d'expiration des caches DNS. Et cela peut nécessiter le redémarrage des clients qui effectuent une seule fois leur résolution DNS à leur initialisation.

La haute disponibilité ne supprime pas le besoin d'une solution de sauvegarde

La réplication en temps réel des solutions de haute disponibilité comme SafeKit ne supprime pas le besoin d'une solution de sauvegarde. Certains événements sont récupérables uniquement avec une solution de sauvegarde. Par exemple, un ransomware cryptant les données répliquées sur le serveur primaire chiffrera les données sur le serveur secondaire avec une réplication en temps réel. Seule une solution de sauvegarde avec une politique de rétention peut résoudre une attaque par ransomware.

Comment fonctionne le cluster miroir de SafeKit avec Windows or Linux ?

Etape 1. Réplication en temps réel

Le serveur 1 (PRIM) exécute l'application Windows or Linux. Les utilisateurs sont connectés à une adresse IP virtuelle. Seules les modifications faites par l'application à l'intérieur des fichiers sont répliquées en continue à travers le réseau.

Réplication de données temps réel reprise sur panne avec Windows or Linux

La réplication est synchrone sans perte de données en cas de panne contrairement à une réplication asynchrone.

Il vous suffit de configurer les noms des répertoires à répliquer dans SafeKit. Il n'y a pas de pré-requis sur l'organisation du disque. Les répertoires peuvent se trouver sur le disque système.

Etape 2. Basculement automatique

Lorsque le serveur 1 est défaillant, SafeKit bascule l'adresse IP virtuelle sur le serveur 2 et redémarre automatiquement l'application Windows or Linux. L'application retrouve les fichiers répliqués à jour sur le serveur 2.

L'application poursuit son exécution sur le serveur 2 en modifiant localement ses fichiers qui ne sont plus répliqués vers le serveur 1.

Basculement automatique de Windows or Linux dans un cluster miroir

Le temps de basculement est égal au temps de détection de la panne (30 secondes par défaut) et au temps de relance de l'application.

Etape 3. Réintégration après panne

A la reprise après panne du serveur 1 (réintégration du serveur 1), SafeKit resynchronise automatiquement les fichiers de ce serveur à partir de l'autre serveur.

Seuls les fichiers modifiés sur le serveur 2 pendant l'inactivité du serveur 1 sont resynchronisés.

Réintégration après panne de Windows or Linux dans un cluster miroir

La réintégration du serveur 1 se fait sans arrêter l'exécution de l'application Windows or Linux sur le serveur 2.

Etape 4. Retour à la normale

Après la réintégration, les fichiers sont à nouveau en mode miroir comme à l'étape 1. Le système est en haute disponibilité avec l'application Windows or Linux qui s'exécute sur le serveur 2 et avec réplication temps réel des modifications vers le serveur 1.

Retour à la normale d'un cluster Windows or Linux actif-passif

Si l'administrateur souhaite que son application s'exécute en priorité sur le serveur 1, il peut exécuter une commande de basculement, soit manuellement à un moment opportun, soit automatiquement par configuration.

Choisissez entre une redondance au niveau application ou au niveau machine virtuelle

Redondance au niveau de l'application

Dans ce type de solution, seules les données applicatives sont répliquées. Et seule l'application est redémarrée en cas de panne.

Application HA - redondance au niveau applicatif

Avec cette solution, des scripts de redémarrage doivent être écrits pour redémarrer l'application.

Nous livrons des modules applicatifs pour mettre en œuvre la redondance au niveau applicatif (comme le module Windows fourni dans l'essai gratuit ci-dessous). Ils sont préconfigurés pour des applications et des bases de données bien connues. Vous pouvez les personnaliser avec vos propres services, données à répliquer, checkers d'application. Et vous pouvez combiner les modules applicatifs pour construire des architectures avancées à plusieurs niveaux.

Cette solution est indépendante de la plate-forme et fonctionne avec des applications à l'intérieur de machines physiques, de machines virtuelles, dans le Cloud. Tout hyperviseur est supporté (VMware, Hyper-V...).

  • Solution pour une nouvelle application (scripts de redémarrage à écrire) : Windows, Linux

Redondance au niveau de machine virtuelle

Dans ce type de solution, la machine virtuelle (VM) complète est répliquée (Application + OS). Et la machine virtuelle complète est redémarrée en cas de panne.

VM HA - redondance au niveau de la machine virtuelle

L'avantage est qu'il n'y a pas de scripts de redémarrage à écrire par application et pas d'adresse IP virtuelle à définir. Si vous ne savez pas comment fonctionne l'application, c'est la meilleure solution.

Cette solution fonctionne avec Windows/Hyper-V et Linux/KVM mais pas avec VMware. Il s'agit d'une solution active/active avec plusieurs machines virtuelles répliquées et redémarrées entre deux nœuds.

Utilisation typique avec SafeKit

Pourquoi une réplication de quelques Tera-octets ?

Temps de resynchronisation après panne (étape 3)

  • Réseau 1 Gb/s ≈ 3 heures pour 1 téraoctet.
  • Réseau 10 Gb/s ≈ 1 heure pour 1 téraoctet ou moins en fonction des performances d'écriture disque.

Alternative

Pourquoi une réplication < 1 000 000 fichiers ?

  • Performance du temps de resynchronisation après panne (étape 3).
  • Temps pour vérifier chaque fichier entre les deux nœuds.

Alternative

  • Placez les nombreux fichiers à répliquer sur un disque dur virtuel / une machine virtuelle.
  • Seuls les fichiers représentant le disque dur virtuel / la machine virtuelle seront répliqués et resynchronisés dans ce cas.

Pourquoi un basculement ≤ 32 VMs répliquées ?

  • Chaque VM s'exécute dans un module miroir indépendant.
  • Maximum de 32 modules miroir exécutés sur le même cluster.

Alternative

  • Utilisez un stockage partagé externe et une autre solution de clustering de VMs.
  • Plus cher, plus complexe.

Pourquoi un réseau LAN/VLAN entre sites distants ?

Alternative

  • Utilisez un équilibreur de charge pour l'adresse IP virtuelle si les 2 nœuds sont dans 2 sous-réseaux (supporté par SafeKit, notamment dans le cloud).
  • Utilisez des solutions de backup avec réplication asynchrone pour un réseau à latence élevée.

SafeKit Quick Installation Guides

New application (real-time replication and failover)


New application (network load balancing and failover)


Database (real-time replication and failover)


Web (network load balancing and failover)


Full VM or container real-time replication and failover


Amazon AWS


Google GCP


Microsoft Azure


Other clouds


Physical security (real-time replication and failover)


Siemens (real-time replication and failover)


Différentiateurs de la solution de haute disponibilité SafeKit