Node-Exporter nicht erreichbar

Alert: HostDown
Critical Monitoring blind
📡
Wahrscheinlich nur der Node-Exporter-Container ist hin, NICHT der ganze Server (sonst kämen gar keine Alerts mehr durch). Aber: solange das offen ist, sehen wir keine Disk/Memory/CPU-Metriken.

Was bedeutet das?

Prometheus kann den node-exporter-Container (Port 9100) seit über 2 Minuten nicht mehr scrapen. Da Prometheus selbst weiter läuft (sonst gäb's keinen Alert), ist höchstwahrscheinlich der node-exporter-Container down, nicht der Host.

⚠️Wie schlimm ist es?

Hoch in dem Sinne: wir fliegen blind für alle Host-Metriken (Disk, Memory, CPU). Wenn dann eine Disk vollläuft, kriegen wir den Alarm dafür nicht. Schnell fixen.

🔧Was tun?

  1. Container-Status:
    docker compose ps node-exporter
    docker logs --tail 50 node-exporter
  2. Restart:
    docker compose restart node-exporter
    sleep 5
    curl -s http://localhost:9100/metrics | head -3   # erwartet: node_* Metriken
  3. Wenn Restart nicht reicht — force-recreate:
    cd /srv/eplamat && docker compose up -d --force-recreate node-exporter
  4. Falls der Container immer wieder crasht: Image-Update ist evtl. inkompatibel. Image-Tag im docker-compose.yml auf vorherige Version pinnen.

🆘Wenn das nicht klappt

Kopier den Alert in Claude. Wenn der Container partout nicht starten will: Image-Manifest checken (docker manifest inspect) oder auf älteren Tag pinnen.