JobMatch
← Back to jobs

Senior Site Reliability Engineer

Guldberg GmbH

RemoteRaunheim, Hesse, GermanyentryFull-time
Posted
today
Source
LinkedIn (remote, Europe)
Field
Engineering

Skills

KubernetesPythonDockerDevOpsCI/CDLinuxAWS

Description

Ihre Aufgaben: - Koordinieren und treiben Sie Aktivitäten im Bereich Site Reliability Engineering (SRE) und Cloud-Betrieb gemeinsam mit den Entwicklungsteams und den Beteiligten voran. - Stellen Sie einen stabilen, sicheren und zuverlässigen Betrieb cloudbasierter Anwendungen und Dienste über verschiedene Cloud-Plattformen hinweg (AWS, Alibaba Cloud) sicher. - Übernehmen Sie die Verantwortung für kritische Vorfälle (P1/P2), leiten Sie die Ursachenanalyse (RCA) und treiben Sie nachhaltige Abhilfemaßnahmen voran. - Verbesserung der Zuverlässigkeit durch Automatisierung, Observability, operative Exzellenz und proaktive Risikominderung. - Definition, Überwachung und Berichterstattung von SLIs, SLOs, SLAs und operativen KPIs. - Planung und Durchführung von Anwendungs- und Plattform-Updates, Releases, Middleware- und Datenbankänderungen sowie Kubernetes-basierten Bereitstellungen. - Koordination und Überwachung von Testaktivitäten, einschließlich Integrations-, Regressions-, Abnahme- und Release-Verifizierungstests. - Zusammenarbeit mit Entwicklungs- und Plattformteams, um produktionsreife und ausfallsichere Bereitstellungen sicherzustellen. - Unterstützung von NIS2-bezogenen Initiativen in den Bereichen Betriebssicherheit, Überwachung, Vorfallmeldung und Risikomanagement. - Förderung der kontinuierlichen Verbesserung in den Bereichen Automatisierung, Skalierbarkeit, Stabilität, Leistung und Zuverlässigkeit. - Abstimmung mit den Bereichen Engineering, Architektur, Sicherheit, Kunden und externen Stakeholdern. - Betreuung von SRE-Ingenieuren und Weitergabe von Best Practices im Betrieb. Ihre Qualifikationen: - 5–8+ Jahre Berufserfahrung in den Bereichen Site Reliability Engineering (SRE), Cloud-Betrieb, DevOps oder IT-Betrieb. - Umfangreiche praktische Erfahrung mit Cloud-Plattformen, vorzugsweise AWS und/oder Alibaba Cloud. - Fundierte Kenntnisse in Linux-Umgebungen, Docker und Kubernetes. - Erfahrung mit Incident-, Problem- und Change-Management in Produktionsumgebungen. - Erfahrung mit Release-Management, Application Lifecycle Management und Plattformbetrieb. - Kenntnisse in den Bereichen Überwachung, Observability, Reliability Engineering und Automatisierung. - Erfahrung mit Python, Bash und CI/CD-Pipelines. - Fundiertes Verständnis von SLIs, SLOs, SLAs, operativen KPIs und SRE-Methoden. - Erfahrung in der Koordination komplexer technischer Themen und in der Zusammenarbeit mit verschiedenen Stakeholdern. - Ausgeprägte Kommunikations- und Mentoring-Fähigkeiten. - Flüssige Englisch- und Deutschkenntnisse

JobMatch aggregates public listings. Always apply through the original posting.