Quality Engineering Manager
Core
Senior production support and reliability engineering professional ensuring availability, stability, and performance of critical business applications and platforms.
Role type
Senior IC Site Reliability Engineer (Production Support)
Builds
Resilient, observable cloud-hosted and hybrid application environments
Domain
Cloud Operations / Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident management, Root cause analysis, Automation scripting, Observability design, Cloud operations, System troubleshooting, SLI/SLO definition, Knowledge management
Preferred skills
Site Reliability Engineering (SRE) practices, Distributed systems support, Microservices architecture, Production readiness reviews
Technologies
PowerShell, Python, Bash/Shell, SQL, REST APIs, Dynatrace, Splunk, Datadog, Azure Monitor, Grafana, Prometheus, OpenTelemetry, AppDynamics, Azure (App Services, AKS, Functions, Storage)
Responsibilities
Serve as technical escalation point for critical production incidents, Lead troubleshooting and root cause analysis, Design and optimize monitoring and observability solutions, Develop automation scripts and workflows, Mentor junior support engineers, Ensure compliance with enterprise risk and security requirements
Seniority
Senior, hands-on IC