Sichere und betreibe moderne Plattformen auf Enterprise-Niveau.
Du begeisterst dich für hochverfügbare Plattformen, Monitoring-Lösungen und den stabilen Betrieb komplexer Kubernetes-Umgebungen? Dann suchen wir genau dich.
Als Senior Platform Operations Engineer (m/w/d) übernimmst du eine zentrale Rolle im Betrieb und der Weiterentwicklung moderner Plattform- und Observability-Lösungen. Dein Fokus liegt nicht auf klassischer Softwareentwicklung, sondern auf der Sicherstellung von Stabilität, Verfügbarkeit und Performance geschäftskritischer Systeme.
Du arbeitest an den Themen Monitoring, Observability, Incident Management, Kubernetes Operations sowie Automation im Betriebsumfeld und sorgst gemeinsam mit unserem Team für einen zuverlässigen Plattformbetrieb.
Du begeisterst dich für hochverfügbare Plattformen, Monitoring-Lösungen und den stabilen Betrieb komplexer Kubernetes-Umgebungen? Dann suchen wir genau dich.
Als Senior Platform Operations Engineer (m/w/d) übernimmst du eine zentrale Rolle im Betrieb und der Weiterentwicklung moderner Plattform- und Observability-Lösungen. Dein Fokus liegt nicht auf klassischer Softwareentwicklung, sondern auf der Sicherstellung von Stabilität, Verfügbarkeit und Performance geschäftskritischer Systeme.
Du arbeitest an den Themen Monitoring, Observability, Incident Management, Kubernetes Operations sowie Automation im Betriebsumfeld und sorgst gemeinsam mit unserem Team für einen zuverlässigen Plattformbetrieb.
Deine Aufgaben
- Betrieb, Betreuung und Weiterentwicklung von Monitoring- und Observability-Plattformen
- Administration und Optimierung von Prometheus, Grafana sowie OpenSearch / ELK
- Überwachung produktiver Systemlandschaften und kontinuierliche Verbesserung von Monitoring- und Alerting-Konzepten
- Bearbeitung von Incidents sowie Unterstützung bei der Wiederherstellung kritischer Services
- Durchführung von Root Cause Analysen und nachhaltige Beseitigung von Störungsursachen
- Unterstützung bei Major Incidents und Koordination technischer Lösungsmaßnahmen
- Betrieb und Optimierung containerisierter Plattformen auf Basis von Kubernetes
- Unterstützung von CI/CD-Prozessen mit Jenkins und ArgoCD
- Erstellung, Pflege und Weiterentwicklung von Runbooks, Betriebsprozessen und technischer Dokumentation
- Automatisierung wiederkehrender Betriebsaufgaben
- Teilnahme an Rufbereitschaften und Schichtmodellen in einer 24x7-Betriebsorganisation


