SRE工程师
Core
Design and develop recommendation system architecture, ensure system stability and high availability, optimize online/offline data flow performance, and build recommendation/data middle platforms.
Role type
Senior Site Reliability Engineer (SRE)
Builds
Recommendation middle platform, data middle platform, automated operations platforms for large-scale clusters
Domain
Internet / Recommendation Systems / Distributed Systems
Deliverable
production ML models
Required skills
Shell, Python, Golang, resource planning, disaster recovery, change management, hardware affinity analysis, automated operations
Preferred skills
large-scale cluster operations, complex operations system design
Responsibilities
Resource planning and key event support, disaster recovery system construction, change efficiency and quality optimization, hardware affinity analysis, operations platform design and development