Salta ai contenuti

Osservabilità

Questa pagina riguarda l’osservabilità della piattaforma Corellix, non dell’infrastruttura che monitora. Serve a rispondere a “come sta l’appliance”, non a “come sta il datacenter”.

Da non confondere con Lamp, che raccoglie log e metriche dei vostri sistemi.

ComponenteRuolo
PrometheusMetriche di cluster, nodi e servizi
LokiLog di tutti i componenti
OpenTelemetry CollectorRaccolta e instradamento di metriche, log e tracce

Sono installati come layer della piattaforma e non richiedono configurazione per funzionare.

Metriche. Nodi (CPU, memoria, disco, rete), cluster Kubernetes (pod, deployment, eventi), servizi applicativi (richieste, latenza, errori), database e cache, storage (capacità, salute dei volumi e delle repliche).

Log. Di tutti i servizi nativi e di tutti i pod. Centralizzati e interrogabili, con ritenzione configurabile.

Tracce. Il percorso di una richiesta attraverso i servizi, utile per capire dove si spende il tempo.

Citadel → Dashboard mostra lo stato di salute complessivo: nodi, componenti, capacità, allarmi di piattaforma. È la prima pagina da aprire.

Per un’analisi più fine:

Terminal window
core diag metrics --component nucleus
core diag logs --component nucleus --since 1h
core diag logs --component nucleus --follow

L’appliance sorveglia se stessa e genera allarmi per:

  • nodo non raggiungibile o non pronto;
  • servizio non disponibile o in riavvio continuo;
  • spazio disco in esaurimento;
  • volume Longhorn degradato o senza repliche sufficienti;
  • database non raggiungibile o replica in ritardo;
  • certificato in scadenza;
  • backup fallito;
  • Arcanum sigillato.

Sono distinti dagli allarmi dell’infrastruttura monitorata: quelli riguardano voi, questi riguardano l’appliance. Compaiono in Citadel e possono essere inoltrati agli stessi canali di notifica.

DatoPredefinito
Metriche ad alta risoluzione15 giorni
Metriche consolidate90 giorni
Log30 giorni
Tracce7 giorni

Si configurano da Citadel. Alzarle richiede spazio: verificate la capacità disponibile prima.

Se avete già un sistema di osservabilità aziendale, l’appliance può inviargli metriche e log invece di essere un’isola.

Terminal window
core observability export set \
--type otlp \
--endpoint https://otel.azienda.loc:4317

Sono supportati OTLP (per qualunque backend compatibile OpenTelemetry), remote write Prometheus e inoltro syslog per i log.

Quando serve raccogliere tutto insieme per una segnalazione, il bundle diagnostico comprende metriche, log e configurazione. Vedi Diagnostica.