Site Reliability Engineer - Cloud Infrastructure - STACKIT (m/w/d)

  • Standort

    Am Campus 1
    74177 Bad Friedrichshall
  • Abteilung / Bereich

    IT - Cloud Services
  • Einstiegslevel

    Berufserfahrene
  • Arbeitsmodell

    Vollzeit
  • Referenznummer

    4323

Schwarz Digits schafft das technologische Fundament für digitale Entscheidungsfreiheit in Europa. Als IT- und Digitalsparte der Schwarz Gruppe entwickeln und verantworten wir einerseits die IT-Infrastrukturen für die Handelssparten Lidl und Kaufland sowie die Schwarz Produktion und PreZero. Gleichzeitig agieren wir als unabhängiger Anbieter am externen Markt, um Unternehmen in ganz Europa bei ihrer digitalen Transformation zu unterstützen. Unsere Kernleistungen bündeln wir in den Bereichen Cloud, Cyber Security, Data & AI, Communication und Workspace. Trage auch du zur digitalen Entscheidungsfreiheit in Europa bei.

Bei uns arbeitest du an der Schnittstelle zwischen Agilität und Sicherheit: Du profitierst von den schnellen Entscheidungswegen, genießt echte Gestaltungsspielräume in deinen Projekten und baust dabei auf das stabile Fundament der Schwarz Gruppe.

Deine Aufgaben

  • Du förderst eine Kultur der Zuverlässigkeit, indem du Engineering-Teams dabei unterstützt, resiliente Services mit minimalem manuellem Aufwand (Toil) zu betreiben.
  • Du agierst als Mentor und Advisor, um die „Reliability-First“-Mentalität in den Entwicklungsteams zu verankern.
  • Du steuerst das ganzheitliche Vorfallsmanagement – von der akuten Krisenkoordination als Incident Commander bis zur nachhaltigen Fehleranalyse (RCA) zur kontinuierlichen Systemverbesserung. 
  • Du standardisierst Operations-Prozesse und etablierst den Reliability Score, um die operative Exzellenz gemeinsam mit den Teams nachhaltig zu steigern.
  • Du implementierst Werkzeuge zur Messbarkeit und Steuerung von Service Level Objectives (SLOs)

Dein Profil

  • Du verfügst über ein ausgeprägtes „Reliability-First“-Mindset und verstehst die Balance zwischen Geschwindigkeit und Stabilität.
  • Du hast fundierte Erfahrung im Site Reliability Engineering (SRE) und kennst die Prinzipien von SLOs, Error Budgets und Toil-Management.
  • Du bist sicher in der Durchführung von Root Cause Analyses (RCA) und der Ableitung von Maßnahmen zur Fehlervermeidung.
  • Du besitzt gute Kenntnisse in der Entwicklung von Automatisierungsskripten oder internen Tools (z. B. Python, Go).
  • Du hast Freude an der Zusammenarbeit mit verschiedenen Stakeholdern in einer dezentralen, europäischen Organisation.

Unsere Benefits

Dein Ansprechpartner

Recruiter Foto Heiko

Heiko Kiefer

Recruiter

  • E-Mail:recruiting@mail.schwarz

Dein Bewerbungsprozess im Überblick

1

Bewerbung

Wir lieben die Einfachheit. Bewirb dich schnell und unkompliziert digital, gerne auch ohne Registrierung.
2

Checkup

Gemeinsam mit dem zuständigen Fachbereich werfen wir einen Blick in deine Unterlagen.
3

Kennenlernen

Bei einem ersten Kennenlernen liegt der Fokus sowohl auf deiner Persönlichkeit als auch auf deiner fachlichen Eignung.
4

Vertragsangebot

Haben wir uns gegenseitig überzeugt? Dann ist dein Arbeitsvertrag digital per Mail auf dem Weg zu dir.
5

Willkommen

Dein erster Arbeitstag bei uns steht an und dein individuelles Onboarding im Team startet. Wir freuen uns auf dich!