Osservabilità
Questa pagina riguarda l’osservabilità della piattaforma Corellix, non dell’infrastruttura che monitora. Serve a rispondere a “come sta l’appliance”, non a “come sta il datacenter”.
Da non confondere con Lamp, che raccoglie log e metriche dei vostri sistemi.
Che cosa c’è
Sezione intitolata “Che cosa c’è”| Componente | Ruolo |
|---|---|
| Prometheus | Metriche di cluster, nodi e servizi |
| Loki | Log di tutti i componenti |
| OpenTelemetry Collector | Raccolta e instradamento di metriche, log e tracce |
Sono installati come layer della piattaforma e non richiedono configurazione per funzionare.
Che cosa viene raccolto
Sezione intitolata “Che cosa viene raccolto”Metriche. Nodi (CPU, memoria, disco, rete), cluster Kubernetes (pod, deployment, eventi), servizi applicativi (richieste, latenza, errori), database e cache, storage (capacità, salute dei volumi e delle repliche).
Log. Di tutti i servizi nativi e di tutti i pod. Centralizzati e interrogabili, con ritenzione configurabile.
Tracce. Il percorso di una richiesta attraverso i servizi, utile per capire dove si spende il tempo.
Dove si guarda
Sezione intitolata “Dove si guarda”Citadel → Dashboard mostra lo stato di salute complessivo: nodi, componenti, capacità, allarmi di piattaforma. È la prima pagina da aprire.
Per un’analisi più fine:
core diag metrics --component nucleuscore diag logs --component nucleus --since 1hcore diag logs --component nucleus --followAllarmi di piattaforma
Sezione intitolata “Allarmi di piattaforma”L’appliance sorveglia se stessa e genera allarmi per:
- nodo non raggiungibile o non pronto;
- servizio non disponibile o in riavvio continuo;
- spazio disco in esaurimento;
- volume Longhorn degradato o senza repliche sufficienti;
- database non raggiungibile o replica in ritardo;
- certificato in scadenza;
- backup fallito;
- Arcanum sigillato.
Sono distinti dagli allarmi dell’infrastruttura monitorata: quelli riguardano voi, questi riguardano l’appliance. Compaiono in Citadel e possono essere inoltrati agli stessi canali di notifica.
Ritenzione
Sezione intitolata “Ritenzione”| Dato | Predefinito |
|---|---|
| Metriche ad alta risoluzione | 15 giorni |
| Metriche consolidate | 90 giorni |
| Log | 30 giorni |
| Tracce | 7 giorni |
Si configurano da Citadel. Alzarle richiede spazio: verificate la capacità disponibile prima.
Esportare verso i vostri sistemi
Sezione intitolata “Esportare verso i vostri sistemi”Se avete già un sistema di osservabilità aziendale, l’appliance può inviargli metriche e log invece di essere un’isola.
core observability export set \ --type otlp \ --endpoint https://otel.azienda.loc:4317Sono supportati OTLP (per qualunque backend compatibile OpenTelemetry), remote write Prometheus e inoltro syslog per i log.
Diagnostica
Sezione intitolata “Diagnostica”Quando serve raccogliere tutto insieme per una segnalazione, il bundle diagnostico comprende metriche, log e configurazione. Vedi Diagnostica.