Technical Engineer (Production Liability Engineer)
Core
Senior production support and reliability engineering professional ensuring availability, stability, and performance of critical business applications and platforms.
Role type
Senior IC production liability engineer (SRE)
Builds
Production-ready, resilient, and observable cloud-hosted applications and platforms
Domain
Enterprise IT, Cloud Operations, Site Reliability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Incident management, root cause analysis, automation scripting, observability, cloud operations, distributed systems troubleshooting, SLI/SLO definition
Preferred skills
Site Reliability Engineering (SRE) practices, AI-assisted operations, Infrastructure as Code (IaC), disaster recovery testing
Technologies
PowerShell, Python, Bash/Shell, SQL, REST APIs, Dynatrace, Splunk, Datadog, Azure Monitor, Grafana, Prometheus, OpenTelemetry, AppDynamics, Azure (App Services, AKS, Functions, Storage)
Responsibilities
Lead troubleshooting and root cause analysis for critical production incidents; Design and optimize monitoring, alerting, and observability solutions; Develop automation scripts and tools to reduce operational toil; Support cloud deployments and operational change activities; Mentor junior support engineers and establish operational knowledge repositories
Seniority
Senior, hands-on IC
