Site Reliability Engineer - Cloud Infrastructure
Core
Manage and stabilize global production infrastructure, ensuring high availability, performance, and cost-efficiency for a fast-growing user base.
Role type
Senior Site Reliability Engineer (Cloud Infrastructure)
Builds
Automated O&M platforms, disaster recovery systems, and scalable delivery standards for mass production.
Domain
Cloud Infrastructure & Distributed Systems
Required skills
Linux, Python, Go, Java, Elastic Search, System Capacity Planning, Fault Diagnosis, Automation, Cost Optimization, Data Protection
Preferred skills
Kubernetes, Docker, Redis, MySQL, MongoDB, Kafka, Spark, Flink, Service Mesh, RPC Framework, AIops
Responsibilities
Establish O&M standards and SOPs for system stability; Troubleshoot technical issues and implement fault resolution strategies; Design and implement automated O&M platforms; Optimize IT costs through resource delivery and capacity assessment; Design data protection plans to meet compliance requirements.
Seniority
Senior, hands-on IC