Expert Site Reliability Engineer
RiyadhOn-siteFull-time
AI Summary
Drives reliability, availability, and operational resilience of critical technology services by implementing advanced SRE practices, automation, and observability across production environments.
About this role
Purpose:
To drive the reliability, availability, scalability, and operational resilience of critical technology services by applying advanced software engineering, automation, observability, and reliability engineering practices.
Main Duties and Responsibilities:
- Define and implement advanced reliability engineering practices across critical technology services.
- Establish and monitor Service Level Indicators (SLIs), Service Level Objectives (SLOs), and reliability targets.
- Design automation to reduce manual operational activities and improve system resilience.
- Develop and enhance monitoring, observability, alerting, and incident detection capabilities.
- Lead technical analysis and resolution of complex production incidents.
- Conduct root-cause analysis and drive permanent corrective and preventive actions.
- Design solutions to improve system availability, scalability, capacity, and disaster resilience.
- Identify reliability risks and recommend architectural and engineering improvements.
- Drive performance engineering and capacity planning for critical services.
- Provide advanced technical guidance and mentorship on SRE practices.
- Promote automation and engineering approaches that reduce operational toil and improve service reliability.
Requirements
QUALIFICATIONS & REQUIREMENTS
- Bachelor’s degree in Computer Science, Software Engineering, IT, or a related field.
- 5+ years of experience in Site Reliability Engineering, DevOps, Platform Engineering, or related roles.
- Strong experience in cloud platforms, Kubernetes, and production environments.
- Strong knowledge of monitoring, observability, alerting, SLIs, SLOs, and reliability metrics.
- Hands-on experience with automation, scripting, CI/CD, and Infrastructure as Code (Terraform).
- Proven experience in complex incident management, troubleshooting, and Root Cause Analysis (RCA).
- Strong understanding of high availability, scalability, performance engineering, capacity planning, and disaster recovery.
- Experience driving reliability improvements and reducing operational toil through automation.
- Strong analytical, problem-solving, and technical leadership skills.
- Experience in Banking, FinTech, or Payment environments is preferred.
Skills
AlertingAutomationCapacity PlanningCI/CDCloud PlatformsDisaster RecoveryHigh AvailabilityInfrastructure As CodeKubernetesMonitoringObservabilityPerformance EngineeringRoot-cause AnalysisScriptingSLIsSLOsTerraform
Explore related jobs
More jobs at Tawantech
- Incident Engineer (Operations Support)Riyadh, Riyadh Province
- SLA Engineer (Operations Support)Riyadh, Riyadh Province
- ServiceNow Support Engineer - Service & Change ManagementRiyadh, Riyadh Province
- Quality Engineer (Operations Support)Riyadh, Riyadh Province
- IT Help DeskRiyadh, Riyadh Province
- Data Privacy ExpertRiyadh, Riyadh Province
Similar Alerting jobs
Jobs in Riyadh
- Country Manager - SaudiEBANX · Riyadh
- Sourcing Inspector/ Car Buyer - Saudi NationalSellAnyCar.com · Riyadh, Riyadh Province
Pre-Sales Systems Engineer, Giga Projects (Riyadh)Everpure · Riyadh, Saudi Arabia- Senior Sales Engineer (Chemical, Process & Industrial)Rotork · Riyadh, Riyadh Province
Jr. AuditorBurjline Builders · Riyadh, Saudi Arabia- Managed Services Client Delivery SpecialistNTT DATA India Private Limited · Riyadh, Saudi Arabia
Browse these categories
Market data for devops / sre / platform engineer roles
All reports →- SeriesRole reportsOne role family at a time: how many openings, what changed this week, who is hiring, what it pays.
- SeriesSalary reportsWhat employers publish in job postings, by level and workplace. Not self-reported pay.
- Market overviewState of tech hiring, September 2026: up 4.8%Tech hiring rose 4.8% month over month in September 2026, with 411,122 new listings. Customer support and account executive roles led the growth.