Diagnostica
Il bundle diagnostico
Sezione intitolata “Il bundle diagnostico”Prima di tutto il resto: se aprite una segnalazione, allegate il bundle. Contiene versioni, stato del cluster, configurazione (senza segreti) e log recenti, e vi risparmia tre scambi di messaggi.
core diag bundle createIl file viene scritto in /var/lib/corellix/diag/ e si scarica anche da Citadel
(Dashboard → Diagnostica).
Per restringerlo a un componente e a una finestra temporale:
core diag bundle create --component nucleus --since 4hI segreti non sono inclusi. Le credenziali sono sostituite da segnaposto.
I primi tre comandi
Sezione intitolata “I primi tre comandi”Nell’ordine, quando qualcosa non va:
core cluster status # i nodi sono tutti pronti? etcd è in salute?core service status --all # quali componenti non sono attivi?core diag disk # c'è spazio?Lo spazio disco è la terza domanda perché è la causa che si manifesta nel modo più vario: un disco pieno non produce l’errore “disco pieno”, produce dieci sintomi diversi in dieci componenti diversi.
Problemi ricorrenti
Sezione intitolata “Problemi ricorrenti”Il portale non risponde
Sezione intitolata “Il portale non risponde”core service status --component lumina- Verificate che il DNS risolva l’hostname del portale verso il VIP.
- Verificate che il VIP sia attivo:
core network show. - Provate dall’indirizzo IP del nodo: se funziona così ma non per nome, il problema è DNS o certificato.
Un agent non riporta
Sezione intitolata “Un agent non riporta”In ordine di frequenza:
- Certificato. L’agent non si fida della CA che ha emesso il certificato di
agents.<dominio>. A differenza di un browser, non chiede: rifiuta. Vedi Certificati e TLS. - DNS. Il record
agents.<dominio>non esiste o non risolve dalla rete dell’agent. - Chiave. La chiave di registrazione è scaduta o è stata revocata.
- Rete. Il traffico HTTPS in uscita verso l’appliance è bloccato.
Sulla macchina, i log dell’agent riportano quale delle quattro.
Una piattaforma collegata ha smesso di riportare
Sezione intitolata “Una piattaforma collegata ha smesso di riportare”Lo stato e l’ultimo errore sono in Sistema → Raccolta dati, e in Citadel sotto Beacon → Ingestion. In ordine di frequenza: credenziali scadute, permessi ridotti sull’utenza, API cambiata dopo un aggiornamento della sorgente, rete.
Una console remota non si apre nel portale
Sezione intitolata “Una console remota non si apre nel portale”Quasi sempre manca il record DNS wildcard *.console.<dominio> o il certificato
non copre quel nome. La console si apre comunque in una scheda separata: se
succede questo, è quello. Vedi
Console remote.
Un pod resta in avvio
Sezione intitolata “Un pod resta in avvio”Verificate prima le sue dipendenze. Nucleus non parte senza PostgreSQL, e dopo un riavvio del cluster il database può metterci qualche minuto — nel frattempo Nucleus attende, ed è normale fino a cinque minuti.
core diag logs --component nucleus --since 15mUn aggiornamento è fallito
Sezione intitolata “Un aggiornamento è fallito”Il passo fallito e l’errore sono nel piano. Le cause tipiche sono in Aggiornamenti. Dopo aver rimosso la causa, rilanciate: riprende dal punto di interruzione.
Corell!A risponde lentamente
Sezione intitolata “Corell!A risponde lentamente”Con modello locale, la prima domanda dopo un’inattività è lenta perché il modello viene caricato. Se ogni domanda è lenta come la prima, il modello viene ricaricato di continuo: verificate se il pod si riavvia spesso.
core diag logs --component corellia --since 1hcore diag logs --component <nome> --since 1hcore diag logs --component <nome> --followcore diag logs --component <nome> --level errorI nomi dei componenti sono quelli dell’inventario — vedi Panoramica.
Verifiche di rete dall’appliance
Sezione intitolata “Verifiche di rete dall’appliance”core diag connectivity --target https://prism.azienda.loc:9440core diag dns --name agents.azienda.loccore diag cert --target https://vcenter.azienda.locSono i controlli che servono a distinguere “la piattaforma sorgente è irraggiungibile” da “le credenziali sono sbagliate”, che nei log applicativi a volte si assomigliano.
Break-glass
Sezione intitolata “Break-glass”Quando serve la shell — un guasto che le API non coprono, o una richiesta esplicita del supporto — la procedura di break-glass la concede. L’accesso è registrato, limitato nel tempo e riportato negli audit.
Non è una scorciatoia. Ogni intervento manuale è una divergenza dallo stato che la piattaforma crede di avere, e la riconciliazione lo annullerà o ci entrerà in conflitto.
Aprire una segnalazione
Sezione intitolata “Aprire una segnalazione”Scrivete a support@corellix.io allegando:
- il bundle diagnostico;
- che cosa è successo, e quando;
- che cosa è cambiato di recente — un aggiornamento, una modifica di rete, un certificato sostituito;
- che cosa avete già verificato.
Il quarto punto è quello che accorcia i tempi più di ogni altro.