Stellenbeschreibung
Site Reliability Engineer (m/w/d)
Freelance-Projekt bei einem führenden Energieinfrastruktur-Unternehmen
Erfahrungslevel: Senior Consultant (3–6 Jahre Erfahrung)
Einsatzort :Remote (95%) / Onsite Deutschland (5%)
Auslastung :80%
Projektstart :01.12.2026
Projektende :30.11.2027
Sprachen: Englisch (C1)
Über das Projekt
Unser Kunde, ein führendes Unternehmen der Energieinfrastruktur, etabliert eine sichere,
On-Premises-Observability-Fähigkeit für eine zentrale Produktorganisation. Der Scope
umfasst Monitoring, Visualisierung, Alerting, Distributed Tracing, Log-Aggregation, Service-
Level-Indikatoren/-Objectives, Deployment-Automatisierung sowie sicherheitskonforme
Konfiguration der Observability-Plattform.
Die vertragliche Leistung wird durch eigenständig erbrachte technische Ergebnisse und
dokumentierte Abnahmenachweise definiert. Ziel ist eine messbare Grundlage für
zuverlässigen Betrieb, schnellere Störungserkennung und -behebung, einheitliche
Observability-Standards sowie eine kontrollierte Weiterentwicklung der On-Premises-
Monitoring-Landschaft.
Ihre Aufgaben
• WP1 – Observability-Architektur: Assessment der bestehenden Grafana-,
Prometheus-, OpenTelemetry-, Elasticsearch-, Linux-, Netzwerk- und Security-
Konfiguration; Definition der Zielarchitektur inkl. Komponentengrenzen,
Datenflüssen, Retention, Zugriffskontrollen und Verfügbarkeitsanforderungen
• WP2 – Monitoring, Visualisierung und Alerting: Definition und Implementierung von
Prometheus-Metriken, Recording- und Alerting-Regeln; Erstellung von Grafana-
Dashboards; Aufbau von Distributed Tracing und Log-Aggregation auf Basis von
OpenTelemetry und Elasticsearch; Definition von SLIs, SLOs und Error-Budget-Regeln
• WP3 – Deployment-Automatisierung: Entwicklung von Automatisierungsskripten und
Konfigurationsartefakten (Python, Bash, Go oder vergleichbare Tools); Definition von
Validierungs-, Rollback-, Versionierungs- und Release-Prozessen; Durchführung
reproduzierbarer Verifikation
• WP4 – Security, Reliability und Handover: Bewertung der gelieferten Konfigurationen
gegenüber Security- und Compliance-Anforderungen; Dokumentation von Kapazität,
Verfügbarkeit, Recoverability und Zugriffskontrollen; Erstellung eines operativen
Handbuchs inkl. Architektur, Fehlerszenarien und Wiederherstellungsprozeduren
Ihr Profil – Must-have
• Mindestens 3 Jahre Berufserfahrung im Bereich Monitoring bzw. Observability
Engineering
• Mindestens 2 Jahre Produktionserfahrung mit Grafana und Prometheus, inkl.
PromQL, Dashboards, Alerting-Regeln und Metrik-Design
• Nachweisbare Implementierungserfahrung mit OpenTelemetry und Elasticsearch für
Distributed Tracing und Log-Aggregation
• Fundierte Linux-Systemadministrations- und Netzwerkerfahrung in On-Premises-
Umgebungen
• Nachweisbare Erfahrung im Design sicherer Observability-Architekturen sowie der
Dokumentation von Security-/Compliance-Kontrollen
• Programmier- und Automatisierungserfahrung in mindestens einer der Sprachen
Python, Bash oder Go
• Erfahrung in der Definition von Service-Level-Indikatoren, Service-Level-Objectives,
Error Budgets und zugehörigen Verifikationskriterien
• Erfahrung in der Erstellung versionierter
Deployment-/Konfigurationsautomatisierung und reproduzierbarer technischer
Dokumentation
• Englischkenntnisse auf C1-Niveau oder vergleichbarer professioneller Kompetenz
Ihr Profil – Nice-to-have
• Erfahrung im Umfeld kritischer Infrastruktur oder vergleichbar stark regulierten On-
Premises-Umgebungen
• Erfahrung mit Enterprise-Security-Praktiken und technischen Compliance-Nachweisen
• Kenntnisse in High-Availability-Design, Kapazitätsplanung, Incident-Diagnostik und
Recovery-Verifikation
• Weitere professionelle Sprachkenntnisse in Deutsch, Französisch oder Niederländisch