Retour au blog
Infrastructure

Conception et deploiement d'un Data Center On-Premise

10 fevrier 202514 min de lecture

Le cloud n’est pas la seule option. Pour certaines organisations, les donnees sensibles, les contraintes de souverainete ou les couts a long terme justifient un data center on-premise. Voici comment j’ai concu et deploie un data center de grade production.

Vision d’architecture

Un data center n’est pas simplement un ensemble de serveurs dans une salle. C’est un systeme coherant ou chaque couche depend de la precedente :

┌─────────────────────────────────────────────────┐
│                  Applications                    │
├─────────────────────────────────────────────────┤
│              Virtualisation (KVM/Proxmox)        │
├─────────────────────────────────────────────────┤
│          Stockage (Ceph / ZFS / NFS)            │
├─────────────────────────────────────────────────┤
│         Reseau (Switches, Firewalls, VLAN)      │
├─────────────────────────────────────────────────┤
│          Physique (Racks, Alimentation)          │
└─────────────────────────────────────────────────┘

Architecture physique

Racks et alimentation

  • Redondance electrique — Deux UPS independants, PDU double alimentation
  • Climatisation — Splitting hot/cold aisle, monitoring temperature
  • Cableage — Cuivre Cat6a pour le management, fibre OM4 pour le trafic data
  • PDU — Distribution de puissance avec mesure par prise

Disposition des serveurs

Rack 1 (Compute)
├── Proxmox Node 1 (64 cœurs, 256 GB RAM)
├── Proxmox Node 2 (64 cœurs, 256 GB RAM)
├── Proxmox Node 3 (64 cœurs, 256 GB RAM)
└── GPU Node (Tesla T4, 15 GB VRAM — inference IA)

Rack 2 (Storage + Network)
├── NAS Synology (backup, 100 TB)
├── Switch principal 10GbE (Mellanox SN2010)
├── Switch secondaire 1GbE (management)
└── Firewall OPNsense (HA pair)

Architecture reseau

Segmentation VLAN

VLAN 10  — Production (10.0.10.0/24)
VLAN 20  — Developpement (10.0.20.0/24)
VLAN 30  — Management (10.0.30.0/24)
VLAN 40  — Stockage (10.0.40.0/24)
VLAN 50  — DMZ (10.0.50.0/24)
VLAN 99  — Isolation (failures, quarantine)

Pare-feu reseau

OPNsense en HA (High Availability) avec :

  • Rules par VLAN — Chaque VLAN a ses propres regles
  • IDS/IPS — Suricata pour la detection d’intrusion
  • VPN site-a-site — IPsec ou WireGuard vers les sites distants
  • NAT — Pour l’acces externe aux services publics

Stockage

Architecture a trois niveaux

  1. Stockage chaud (ZFS sur NVMe) — Bases de donnees, VMs critiques

    • RAID-Z2, compression LZ4, deduplication optionnelle
    • Snapshots horaires, replication vers le froid
  2. Stockage temeraire (Ceph) — Donnees d’application, images conteneurs

    • 3 replicas, erasure coding pour l’archivage
    • Pool separe par type de donnees
  3. Stockage froid (NAS Synology) — Backups, archives

    • NFS v4.1, chiffrement au repos
    • Replication hors-site (second data center ou cloud)

Important : le stockage est la fondation

Sans stockage fiable, rien d'autre ne fonctionne.
  → Investir en premier dans la fiabilite disque
  → SMART monitoring + alertes proactives
  → Tests de restauration reguliers

Virtualisation

Proxmox VE sur Gentoo

Proxmox est base sur Debian mais tourne sur des nœuds Gentoo optimises :

  • Kernel custom — Tuning I/O scheduler, memory management
  • GPU passthrough — Pour l’inference IA (llama.cpp, vLLM)
  • Haute disponibilite — Migration en direct des VMs entre nœuds
  • Stockage Ceph — Stockage distribué partagé entre les nœuds
Proxmox Cluster
├── Node 1: VMs production + conteneurs
├── Node 2: VMs production + conteneurs
├── Node 3: VMs staging/dev + services partages
└── GPU Node: Inference IA (LLM)

Supervision et monitoring

Stack d’observabilite

  • Prometheus — Metriques systeme et applicatives
  • Grafana — Tableaux de bord unifies
  • Loki — Logs centralises
  • Alertmanager — Notification (email, Slack, PagerDuty)
  • Zabbix — Monitoring reseau (switches, firewalls, PDU)

Metriques cles

Metrique Seuil d’alerte
Utilisation CPU > 80% pendant 15 min
Utilisation RAM > 85%
Utilisation disque > 75%
Temperature salle > 24°C
Latence reseau > 5ms inter-VLAN

Automatisation

Ansible pour la configuration

# Playbook de base — Configuration d'un nœud Proxmox
- hosts: proxmox_nodes
  roles:
    - common
    - kernel_tuning
    - zfs_optimization
    - monitoring_agent
    - security_hardening

Terraform pour l’infrastructure

Même on-premise, l’IaC est essentiel :

  • Provisionnement des VMs via l’API Proxmox
  • Configuration des VLANs et firewall rules
  • Deploiement des services (Kubernetes, monitoring, etc.)

Leçons apprises

  1. Le cableage propre est la moitie du travail — Un data center desordonne est un data center lent
  2. La redondance electrique n’est pas optionnelle — Deux UPS, deux PDU, deux alimentations par serveur
  3. Tester les backups — Un backup non teste n’est pas un backup
  4. Documenter le physique — Plan de rack, schematique reseau, inventaire
  5. Prevoyer la capacite — Les nœuds de stockage et de compute croissent plus vite que prevu

Conclusion

Un data center on-premise de grade enterprise demande une attention detaillee a chaque couche — du cableage physique aux politiques de backup. C’est un investissement initial important mais qui offre un controle total sur l’infrastructure, les donnees et les couts a long terme.

Partager :