Unsere Fragen: • Was macht unsere Anwendung (Auslastung) • Wie ist es zu einen Zustand gekommen • Was ist seit wann kaputt • Korrelationen? (Mehr CPU-Verbrauch mit neuer Version) • Trends (Lastspitzen, Memoryleaks)
Events • Metriken: aggregierte Zahlenreihen / Messwerte • CPU/Memory Verbrauch, Antwortzeiten • Alerts • Trace: Repräsentation von kausal zusammenhängenden verteilten Events A log is an event that happened and a metric is a measurement of the health of a system. [Sridharan]
/var/log/*) • Metrikwerte & CorrelationIds in Logeinträge Traces and metrics are an abstraction built on top of logs that pre- process and encode information along two orthogonal axes, one being request-centric (trace), the other being system-centric (metric). [Sridharan]
Ad-Hoc Abfragen stark beschränkt • Nicht alle Metriken aus Events ableitbar (periodic, system-level measurements) • Skaliert nicht • Reaggregationen oft nicht Sinnvoll (p99 mehrerer Instanzen) Text Logs: eingesammelt => aggregiert Messwerte: aggregiert => eingesammelt
Elastic, Kafka) • Einsatz von Micrometer • wie Slf4J für Logs • default vieler Frameworks, z.B. Spring Boot • Prometheus Instanz betreiben Konfigurieren • Jaeger • Header weiterreichen • Libraries Instrumentieren (ggf. mit Java Agent) • Jaeger + Datenbank betreiben Beides wird von Rancher bereitgestellt