Conception et deploiement d'un Data Center On-Premise
Le cloud n’est pas la seule option. Pour certaines organisations, les donnees sensibles, les contraintes de souverainete ou les couts a long terme justifient un data center on-premise. Voici comment j’ai concu et deploie un data center de grade production.
Vision d’architecture
Un data center n’est pas simplement un ensemble de serveurs dans une salle. C’est un systeme coherant ou chaque couche depend de la precedente :
┌─────────────────────────────────────────────────┐
│ Applications │
├─────────────────────────────────────────────────┤
│ Virtualisation (KVM/Proxmox) │
├─────────────────────────────────────────────────┤
│ Stockage (Ceph / ZFS / NFS) │
├─────────────────────────────────────────────────┤
│ Reseau (Switches, Firewalls, VLAN) │
├─────────────────────────────────────────────────┤
│ Physique (Racks, Alimentation) │
└─────────────────────────────────────────────────┘
Architecture physique
Racks et alimentation
- Redondance electrique — Deux UPS independants, PDU double alimentation
- Climatisation — Splitting hot/cold aisle, monitoring temperature
- Cableage — Cuivre Cat6a pour le management, fibre OM4 pour le trafic data
- PDU — Distribution de puissance avec mesure par prise
Disposition des serveurs
Rack 1 (Compute)
├── Proxmox Node 1 (64 cœurs, 256 GB RAM)
├── Proxmox Node 2 (64 cœurs, 256 GB RAM)
├── Proxmox Node 3 (64 cœurs, 256 GB RAM)
└── GPU Node (Tesla T4, 15 GB VRAM — inference IA)
Rack 2 (Storage + Network)
├── NAS Synology (backup, 100 TB)
├── Switch principal 10GbE (Mellanox SN2010)
├── Switch secondaire 1GbE (management)
└── Firewall OPNsense (HA pair)
Architecture reseau
Segmentation VLAN
VLAN 10 — Production (10.0.10.0/24)
VLAN 20 — Developpement (10.0.20.0/24)
VLAN 30 — Management (10.0.30.0/24)
VLAN 40 — Stockage (10.0.40.0/24)
VLAN 50 — DMZ (10.0.50.0/24)
VLAN 99 — Isolation (failures, quarantine)
Pare-feu reseau
OPNsense en HA (High Availability) avec :
- Rules par VLAN — Chaque VLAN a ses propres regles
- IDS/IPS — Suricata pour la detection d’intrusion
- VPN site-a-site — IPsec ou WireGuard vers les sites distants
- NAT — Pour l’acces externe aux services publics
Stockage
Architecture a trois niveaux
-
Stockage chaud (ZFS sur NVMe) — Bases de donnees, VMs critiques
- RAID-Z2, compression LZ4, deduplication optionnelle
- Snapshots horaires, replication vers le froid
-
Stockage temeraire (Ceph) — Donnees d’application, images conteneurs
- 3 replicas, erasure coding pour l’archivage
- Pool separe par type de donnees
-
Stockage froid (NAS Synology) — Backups, archives
- NFS v4.1, chiffrement au repos
- Replication hors-site (second data center ou cloud)
Important : le stockage est la fondation
Sans stockage fiable, rien d'autre ne fonctionne.
→ Investir en premier dans la fiabilite disque
→ SMART monitoring + alertes proactives
→ Tests de restauration reguliers
Virtualisation
Proxmox VE sur Gentoo
Proxmox est base sur Debian mais tourne sur des nœuds Gentoo optimises :
- Kernel custom — Tuning I/O scheduler, memory management
- GPU passthrough — Pour l’inference IA (llama.cpp, vLLM)
- Haute disponibilite — Migration en direct des VMs entre nœuds
- Stockage Ceph — Stockage distribué partagé entre les nœuds
Proxmox Cluster
├── Node 1: VMs production + conteneurs
├── Node 2: VMs production + conteneurs
├── Node 3: VMs staging/dev + services partages
└── GPU Node: Inference IA (LLM)
Supervision et monitoring
Stack d’observabilite
- Prometheus — Metriques systeme et applicatives
- Grafana — Tableaux de bord unifies
- Loki — Logs centralises
- Alertmanager — Notification (email, Slack, PagerDuty)
- Zabbix — Monitoring reseau (switches, firewalls, PDU)
Metriques cles
| Metrique | Seuil d’alerte |
|---|---|
| Utilisation CPU | > 80% pendant 15 min |
| Utilisation RAM | > 85% |
| Utilisation disque | > 75% |
| Temperature salle | > 24°C |
| Latence reseau | > 5ms inter-VLAN |
Automatisation
Ansible pour la configuration
# Playbook de base — Configuration d'un nœud Proxmox
- hosts: proxmox_nodes
roles:
- common
- kernel_tuning
- zfs_optimization
- monitoring_agent
- security_hardening
Terraform pour l’infrastructure
Même on-premise, l’IaC est essentiel :
- Provisionnement des VMs via l’API Proxmox
- Configuration des VLANs et firewall rules
- Deploiement des services (Kubernetes, monitoring, etc.)
Leçons apprises
- Le cableage propre est la moitie du travail — Un data center desordonne est un data center lent
- La redondance electrique n’est pas optionnelle — Deux UPS, deux PDU, deux alimentations par serveur
- Tester les backups — Un backup non teste n’est pas un backup
- Documenter le physique — Plan de rack, schematique reseau, inventaire
- Prevoyer la capacite — Les nœuds de stockage et de compute croissent plus vite que prevu
Conclusion
Un data center on-premise de grade enterprise demande une attention detaillee a chaque couche — du cableage physique aux politiques de backup. C’est un investissement initial important mais qui offre un controle total sur l’infrastructure, les donnees et les couts a long terme.