Senior Site Reliability Engineer
RemoteRaunheim, Hesse, GermanyentryFull-time
- Posted
- today
- Source
- LinkedIn (remote, Europe)
- Field
- Engineering
Skills
KubernetesPythonDockerDevOpsCI/CDLinuxAWS
Description
Ihre Aufgaben:
- Koordinieren und treiben Sie Aktivitäten im Bereich Site Reliability Engineering (SRE) und Cloud-Betrieb gemeinsam mit den Entwicklungsteams und den Beteiligten voran.
- Stellen Sie einen stabilen, sicheren und zuverlässigen Betrieb cloudbasierter Anwendungen und Dienste über verschiedene Cloud-Plattformen hinweg (AWS, Alibaba Cloud) sicher.
- Übernehmen Sie die Verantwortung für kritische Vorfälle (P1/P2), leiten Sie die Ursachenanalyse (RCA) und treiben Sie nachhaltige Abhilfemaßnahmen voran.
- Verbesserung der Zuverlässigkeit durch Automatisierung, Observability, operative Exzellenz und proaktive Risikominderung.
- Definition, Überwachung und Berichterstattung von SLIs, SLOs, SLAs und operativen KPIs.
- Planung und Durchführung von Anwendungs- und Plattform-Updates, Releases, Middleware- und Datenbankänderungen sowie Kubernetes-basierten Bereitstellungen.
- Koordination und Überwachung von Testaktivitäten, einschließlich Integrations-, Regressions-, Abnahme- und Release-Verifizierungstests.
- Zusammenarbeit mit Entwicklungs- und Plattformteams, um produktionsreife und ausfallsichere Bereitstellungen sicherzustellen.
- Unterstützung von NIS2-bezogenen Initiativen in den Bereichen Betriebssicherheit, Überwachung, Vorfallmeldung und Risikomanagement.
- Förderung der kontinuierlichen Verbesserung in den Bereichen Automatisierung, Skalierbarkeit, Stabilität, Leistung und Zuverlässigkeit.
- Abstimmung mit den Bereichen Engineering, Architektur, Sicherheit, Kunden und externen Stakeholdern.
- Betreuung von SRE-Ingenieuren und Weitergabe von Best Practices im Betrieb.
Ihre Qualifikationen:
- 5–8+ Jahre Berufserfahrung in den Bereichen Site Reliability Engineering (SRE), Cloud-Betrieb, DevOps oder IT-Betrieb.
- Umfangreiche praktische Erfahrung mit Cloud-Plattformen, vorzugsweise AWS und/oder Alibaba Cloud.
- Fundierte Kenntnisse in Linux-Umgebungen, Docker und Kubernetes.
- Erfahrung mit Incident-, Problem- und Change-Management in Produktionsumgebungen.
- Erfahrung mit Release-Management, Application Lifecycle Management und Plattformbetrieb.
- Kenntnisse in den Bereichen Überwachung, Observability, Reliability Engineering und Automatisierung.
- Erfahrung mit Python, Bash und CI/CD-Pipelines.
- Fundiertes Verständnis von SLIs, SLOs, SLAs, operativen KPIs und SRE-Methoden.
- Erfahrung in der Koordination komplexer technischer Themen und in der Zusammenarbeit mit verschiedenen Stakeholdern.
- Ausgeprägte Kommunikations- und Mentoring-Fähigkeiten.
- Flüssige Englisch- und Deutschkenntnisse
JobMatch aggregates public listings. Always apply through the original posting.