
Posted 28 days ago
Team Lead - Site Reliability Engineering (all genders)
AI Summary
Leads Site Reliability Engineering for a product-discovery eCommerce platform, driving the migration to Kubernetes on Harvester across on-prem and cloud environments while managing a 4-person hosting team.
About this role
Introduction
FACT-Finder entwickelt Product-Discovery-Technologie für den eCommerce und ist mit den Produkten Next Generation und Infinity bei führenden Online-Shops in Europa im Einsatz. Aktuell modernisieren wir unser Hosting konsequent in Richtung Kubernetes auf Harvester – als on-prem Hybrid mit der Option, mittelfristig vollständig in die Cloud zu skalieren. Als Team Lead Site Reliability Engineering (all genders) verantwortest du Reliability, Skalierbarkeit und Kosten unserer Hosting-Umgebungen, treibst diese Transformation end-to-end voran und führst das Team, das sie umsetzt.
Deine Aufgaben
- Du verantwortest die operative Gesundheit unseres Hostings über On-Premise (Frankfurt, Stockholm) und Cloud hinweg – Verfügbarkeit, Performance, Incident Management.
- Du treibst die Modernisierung in Richtung Kubernetes auf Harvester aktiv voran: Cluster-Topologie, Storage (Longhorn), Networking (VLAN, Load Balancing, Ingress), Backup und Disaster Recovery.
- Du baust eine produktionsreife k8s-Plattform auf: Lifecycle, Upgrades, RBAC, Secrets, GitOps (Argo CD / Flux), Observability und Policy-Guardrails.
- Du gestaltest den NG Search Operator (Custom Kubernetes Operator) und löst Auto-Scaling (HPA, VPA, KEDA, Cluster Autoscaler) für die aktuelle Architektur.
- Du definierst unser On-Prem-Hybrid-Modell konkret: welche Workloads laufen wo, wie burst’en wir in die Cloud, wie halten wir Latenz und Kosten im Griff – und hältst die Architektur portabel genug für einen späteren Cloud-Only-Schritt.
- Du verantwortest Kapazitätsplanung und Hosting-Kosten und machst Kosten zu einem gezielt steuerbaren Hebel.
- Du führst und entwickelst unser derzeit 4-köpfiges Hosting-Team fachlich und disziplinarisch, verantwortest Performance und prägst die technische Standards- und Ownership-Kultur.
- Du machst AI zum festen Bestandteil unserer Operations: Diagnose, Automatisierung, Monitoring und Insight.
Dein Profil
- Fundierter Hintergrund in Infrastructure oder Platform Engineering über On-Premise und Cloud hinweg.
- Hands-on Tiefe mit Kubernetes in Produktion: Cluster-Lifecycle, Upgrades, Networking, Storage, RBAC, Observability, GitOps-Delivery.
- Nachweislich starke Führungserfahrung, exzellente Kommunikation und Stakeholder-Management.
- Idealerweise praktische Erfahrung mit Harvester oder vergleichbaren HCI-/Virtualisierungsplattformen (KubeVirt, vSphere/ESXi, OpenStack).
- Erfahrung mit einer echten Migration von Bare Metal / klassischen VMs auf eine k8s-basierte Plattform – inklusive stateful Workloads, Storage-Migration, Cutover und Rollback.
- Sicherer Umgang mit Kubernetes Operators (Custom Controllers / CRDs), idealerweise für stateful Systeme wie Search, Datenbanken oder Streaming.
- Solides Verständnis von Auto-Scaling-Primitiven (HPA, VPA, Cluster Autoscaler, KEDA) und deren Zusammenspiel mit Kapazitätsplanung.
- Erfahrung mit On-Prem-Hybrid-Architekturen und der Verantwortung für Reliability, Kapazität und Kosten produktiver Systeme.
- Hands-on Fluency im Einsatz von AI-Tools im operativen Betrieb.
- Sehr gute Englischkenntnisse; Deutsch von Vorteil.
THE JOY OF WORKING WITH US
- Impact from day one: Deine Arbeit wirkt direkt auf die Umsätze führender eCommerce-Marken in Europa.
- Führungsrolle mit Gestaltungsspielraum: Du führst ein eingespieltes Team und gestaltest unsere Plattform in einer entscheidenden Phase unserer Transformation.
- Moderner Tech-Stack: Kubernetes, Harvester, GitOps, Auto-Scaling und ein spannender Weg in Richtung Cloud – mit Raum, Dinge neu und richtig zu bauen.
- AI-first Mindset: Wir nutzen AI nicht als Buzzword, sondern als festen Bestandteil unserer täglichen Arbeit.
- Ownership & Wachstum: Klare Verantwortung, kurze Entscheidungswege und die Möglichkeit, deine Rolle aktiv mitzugestalten.
- Flexibles Arbeiten: Hybrides Arbeitsmodell mit Fokus auf Ergebnisse.
- Starkes Team: Erfahrene Engineers, offene Feedback-Kultur und ein Umfeld, in dem Reliability als Engineering-Disziplin ernst genommen wird.
- Attraktive Benefits: Wettbewerbsfähiges Gehalt, moderne Ausstattung, Weiterbildungsbudget und regelmäßige Team-Events.
Standort
Berlin, München, Pforzheim oder Stockholm (hybrid)
Skills
Explore related jobs
More jobs at FactFinder
Senior Site Reliability Engineer / SRE – Kubernetes & Hybrid Cloud (m/f/d)Berlin, Germany
Senior Site Reliability Engineer (all genders)Berlin, Germany
Team Lead - Site Reliability Engineering (all genders)Berlin, Germany
Senior Customer Success Manager (m/w/d) – B2B SaaS / eCommerce – Berlin, München, Pforzheim (Hybrid)Berlin, Germany
Customer Success Manager (m/w/d)Berlin, Germany
Similar AI Tools jobs
Jobs in Berlin
(Mini-/Studentenjob) Stewarding für Events, Gastro, Stadien und Hochzeiten (gn)Young Talents GmbH · Berlin, Berlin
(Mini-/Studentenjob) in der Logistik: Event-, Veranstaltungs-, und Messelogistik (gn)Young Talents GmbH · Berlin, Berlin
Aushilfe (gn) in der Logistik: Event-, Messe- und Veranstaltungsbereich (Mini-/Studentenjob)Young Talents GmbH · Berlin, Berlin
Senior Account Executive - Enterprise Sales (f/m/x)Netconomy GmbH · Berlin, Dortmund
Verkaufstalent Shop in Shop KaDeWe BerlinMy Jewellery · Berlin, Berlijn
Minijobber Shop in Shop KaDaWe BerlinMy Jewellery · Berlin, Berlijn
Browse these categories
Market data for devops / sre / platform engineer roles
All reports →- SeriesRole reportsOne role family at a time: how many openings, what changed this week, who is hiring, what it pays.
- SeriesSalary reportsWhat employers publish in job postings, by level and workplace. Not self-reported pay.
- Market overviewState of tech hiring, September 2026: up 4.8%Tech hiring rose 4.8% month over month in September 2026, with 411,122 new listings. Customer support and account executive roles led the growth.