Files
management/docs/issues/0002-game-01-host-von-cfgmon-aus-nicht-erreichbar-2.md
T

68 lines
3.6 KiB
Markdown
Raw Normal View History

---
type: issue
id: "0002"
status: waiting
created: 2026-08-01
milestone: M1
priority: medium
host: game
wartegrund: "Wartet auf Aufnahme des GAME-Hosts in den Hetzner-vSwitch (Handgriff sorb in der Cloud-Console); erst danach lassen sich die Scrape-Targets auf die private Adresse umstellen. Frist: der TargetDown-Silence 3c8f1a2e laeuft am 2026-09-14 ab."
gitlab_iid: "2"
related: []
---
# GAME-01: Host von CFGMON aus nicht erreichbar, 2 Prometheus-Targets down
> Import aus [management#2](https://git.lab/axion1337.chat/management/-/issues/2) (2026-08-11). Kommentare und Verlauf bleiben dort; kanonisch ist ab jetzt diese Datei (ADR-0012).
Zwei Scrape-Targets sind down (`gameserver_cadvisor` 157.90.155.206:8080,
`pterodactyl_host_node` :9100, beide `context deadline exceeded`) — bestand schon
**vor** dem Monitoring-Rework; `up == 1` in 45 Tagen Retention **nie**.
**Eingrenzung 2026-08-01 (von CFGMON aus):** Port 80/443 offen und antworten sofort;
22/8080/9100 Timeout (nicht refused → Signatur eines Paketfilters davor); ICMP 100 %
Verlust; Host ist **nicht** im vSwitch 10.0.0.0/24. Damit ist „Host tot/umgezogen"
ausgeschlossen und die **Hetzner-Cloud-Firewall die wahrscheinliche Ursache**;
Zusatzbedingung möglich: Exporter binden nur 127.0.0.1.
**Empfehlung: nicht über die öffentliche IP freigeben**, sondern den Host in den
Hetzner-vSwitch aufnehmen (Modell k3s: CFGMON scrapt 10.0.0.2:9100 privat, keine im
Internet offenen Exporter-Ports). Danach in `threadnet-operating`
`monitoring/prometheus/prometheus.yml` die Targets von der rohen IP auf die private
Adresse umstellen.
⚠️ **Alerting-Silences laufen am 2026-08-04 01:30 UTC ab** (`abedb8a2…` und
`0f64aa3c…`); danach melden sich beide `TargetDown`-Alarme alle 4 h zurück. Verlängern:
`docker compose exec alertmanager amtool silence expire <id>
--alertmanager.url=http://localhost:9093` aus `/opt/threadnet-operating/monitoring`.
Quelle: [hosts/game.md](https://git.lab/axion1337.chat/management/-/blob/main/hosts/game.md)
---
*Übernommen aus dem Backlogs-Markdown beim Framework-Umbau 2026-08-01 (voller Wortlaut: Git-Historie der Datei).*
## Nachgeprüft 2026-08-15
Exporter weiterhin **nicht erreichbar** (Messung vom Mac, öffentliche IP):
`157.90.155.206:8080` und `:9100` laufen in den Timeout, während `:443` sofort antwortet —
die Signatur eines Paketfilters davor, also unverändert das im Issue beschriebene Bild.
Nichts hat sich von allein gelöst.
**Alert-Nebenwirkung — behoben 2026-08-15:** Die ursprünglichen Silences (`abedb8a2…`,
`0f64aa3c…`) liefen am **2026-08-04** ab; danach meldete `TargetDown` für beide Targets rund
elf Tage lang alle 4 h. Dauerfeuer ohne Adressat stumpft die Alarmwege ab — schlimmer als
kein Alarm, zumal die Backup-Alarme aus #0030 über denselben Weg laufen.
Neuer Silence gesetzt (sorb, 2026-08-15): **ID `3c8f1a2e`**, gültig bis **2026-09-14 12:00 UTC**.
- **Matcher:** `alertname="TargetDown"` **plus** `job=~"gameserver_cadvisor|pterodactyl_host_node"`
bewusst eng. Ein Silence nur auf `alertname` hätte jeden künftigen `TargetDown` verschluckt,
auch für Dienste, die zählen. Genau daran werden Silences gefährlich.
- **Ablaufdatum statt Dauerstille:** Läuft der Silence aus, ohne dass der vSwitch-Umzug erfolgt
ist, meldet sich der Alarm zurück und erzwingt eine Neubewertung. Erfolgt der Umzug vorher,
läuft der Silence einfach ins Leere — die Targets sind dann wieder `up`.
- **Kommentar im Silence** nennt Grund, Ausstiegsbedingung und dieses Issue, damit er in drei
Monaten bewertbar bleibt statt blind verlängert zu werden.
⚠️ **Damit ist der 2026-09-14 die faktische Frist dieses Issues** — nicht nur eine
Aufräumnotiz.