Performance Engineer - Software Engineering, MTS
Core
Designing and executing chaos engineering experiments and performance simulations to validate service resilience, availability SLOs, and fault-tolerance in complex cloud applications.
Role type
Senior IC Performance & Resilience Engineer
Builds
Production cloud services with guaranteed availability under real-world failure conditions
Domain
Cloud infrastructure, distributed systems, reliability engineering
Deliverable
production ML models | product features | dashboards & analysis | research | client delivery | infrastructure | physical/clinical work
Required skills
chaos engineering, performance engineering, system architecture analysis, Linux OS tuning, Java/Python/Go programming, load generation tools, automation scripting, database optimization, middle-tier component knowledge, network partition simulation
Preferred skills
chaos engineering platforms (Steadybit, Gremlin, Litmus), AWS managed service failure modes, multi-AZ/multi-region resilience architectures
Technologies
Steadybit, AWS Fault Injection Service, JMeter, Linux, Java, Python, Go, Kafka, DynamoDB, Kinesis, EKS, Route53, NLB
Responsibilities
Design and implement scalability, stress, reliability, and longevity simulations; Execute chaos experiments (AZ failures, dependency blackholes, latency injection); Validate circuit breaking, retry/backoff, and graceful degradation mechanisms; Produce chaos test reports with findings and remediation recommendations; Partner with service owners to define and validate availability targets; Influence architecture by offering solutions for performance and fault-tolerance challenges
Seniority
Senior, hands-on IC