L'elasticità si basa sul monitoraggio continuo e sul processo decisionale automatizzato. La piattaforma cloud tiene traccia delle metriche di utilizzo delle risorse, ad esempio l'utilizzo della CPU, il consumo di memoria, la capacità di archiviazione nel cloud, il traffico di rete e i tempi di risposta delle applicazioni. Queste metriche passano agli strumenti di monitoraggio che confrontano le prestazioni attuali con le soglie predefinite.
Il flusso di lavoro segue una tendenza coerente. I sistemi di monitoraggio raccolgono i dati sulle prestazioni dall'infrastruttura ad intervalli di pochi secondi o minuti. Quando le metriche superano una soglia configurata, il sistema attiva il ridimensionamento. Ad esempio, se l'utilizzo della CPU raggiunge l'80% per un periodo prolungato, la piattaforma effettua il provisioning di risorse aggiuntive. Se l'utilizzo scende sotto il 30%, si ridimensiona.
Ciò avviene tramite i livelli di orchestrazione che gestiscono il processo di provisioning:
Durante gli eventi di aumento delle prestazioni: il sistema avvia nuove istanze di calcolo, le collega ai servizi di bilanciamento del carico e instrada il traffico alla capacità aggiuntiva. Le applicazioni iniziano a ricevere richieste sulle nuove risorse nel giro di pochi minuti.
Durante gli eventi di riduzione delle prestazioni: la piattaforma svuota le connessioni dalle risorse sottoutilizzate, termina le istanze non necessarie e consolida i carichi di lavoro in un numero inferiore di macchine.
Quando la domanda si normalizza, il sistema torna alla capacità di base. Un'applicazione per la vendita al dettaglio può essere eseguita su cinque server durante il normale orario di ufficio, scalare fino a 20 server durante una vendita flash e poi tornare a cinque quando il traffico si normalizza.
L'efficacia dei sistemi elastici dipende interamente dalla configurazione. Se si impostano soglie in modo troppo conservativo, i costi delle risorse inattive saranno troppo alti; se invece si impostano in modo troppo aggressivo, si rischierà una riduzione delle prestazioni durante i picchi imprevisti. I criteri definiscono non solo quando scalare, ma anche la velocità e la portata.