Omikron Data Quality GmbH logo
Posted 5d agoBerlin, Pforzheim, Stockholm, Munich

Senior Site Reliability Engineer (all genders)

SeniorHybrid (Berlin)~€6,700 – €8,750 / moEst.
Required Skills
KubernetesGitOpsArgo CDFluxObservabilitySLOsIncident Response
Job Description
  • Du definierst und verantwortest SLOs, SLIs und Error Budgets über beide Produkte hinweg und triffst datenbasierte Entscheidungen zu Reliability und Performance.
  • Du treibst Incident Response voran: schnelle Detektion, klare Kommunikation, blameless Postmortems und nachhaltige Follow-ups.
  • Du reduzierst manuelle Arbeit konsequent durch Automatisierung und GitOps (z. B. Argo CD / Flux) und baust self-healing sowie self-service Fähigkeiten aus.
  • Du unterstützt den Aufbau eines NG Search Operators (Custom Kubernetes Operator / CRDs) und die Einführung von Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler).
  • Du entwickelst unsere Observability weiter – Metrics, Logs, Traces, Alerting und Runbooks, die on-call wirklich helfen.
  • Du planst Kapazität und Kosten über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – inklusive Burst-Szenarien in die Public Cloud.
  • Du nutzt AI-Tools, um Diagnose, Alerting und operative Workflows spürbar zu
  • ]]>
  • Erfahrung als SRE, Infrastructure oder Production Engineer in einem SaaS- oder Plattform-Umfeld – oder ein starker Software-/Operations-Hintergrund mit klarem Willen, in die SRE-Rolle hineinzuwachsen.
  • Solides Verständnis von SLOs, Error Budgets, Incident Management und Observability.
  • Hands-on Erfahrung mit Kubernetes und Interesse an Cluster-Lifecycle, Upgrades und Operator-Pattern.
  • Erfahrung oder starkes Interesse an Harvester bzw. vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
  • Vertrautheit mit GitOps (Argo CD / Flux), Container Storage (Longhorn, Ceph) und Kubernetes Networking (Load Balancing, Ingress).
  • Kenntnisse zu Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und Kapazitätsplanung on-prem und in der Cloud.
  • Verständnis für Netzwerke in produktionsnahen Rechenzentren (u. a. VLAN).
  • Ausgeprägter Automatisierungsinstinkt und eine Haltung, Toil strukturell zu eliminieren.
  • Praktische Erfahrung im Einsatz von AI-Tools im operativen Betrieb.
  • Sehr gute Englischkenntnisse; Deutsch von Vorteil.
  • ]]>
  • Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
  • Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen.
  • AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
  • Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
  • Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
  • Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.
  • ]]>
    Ready to apply? Optimize your CV for this specific jobAI customizes your experience bullets and increases chances to get hired.

    Similar Openings in DevOps & Cloud

    View all in category