Platform DR & Capacity Engineer
Core
Builds disaster recovery solutions and capacity planning frameworks to ensure platform business continuity and efficient resource allocation.
Role type
Senior IC Platform DR & Capacity Engineer
Builds
Disaster recovery tooling, capacity planning frameworks, and monitoring solutions for the AI-infused scenario planning platform.
Domain
SaaS / Cloud Infrastructure / Platform Engineering
Deliverable
production ML models | infrastructure
Required skills
Linux administration, Kubernetes administration, scripting for automation, distributed systems diagnosis, capacity planning, disaster recovery strategy, cloud architecture (cloud/on-prem), Agile practices
Preferred skills
SaaS support experience, Incident Management & Post Mortems, observability & monitoring, public cloud operations (AWS/GCP/Azure), Infrastructure as Code
Technologies
Kubernetes, Linux, Cloud platforms (AWS, GCP, Azure), Scripting languages
Responsibilities
Build tooling to support DR plans and track progress against KPIs; Ensure DR solutions are adequate, maintained, and tested; Develop and implement capacity planning tooling, frameworks, and strategies; Manage capacity deviations and implement improvement initiatives; Provide capacity requirements and impact assessments for new services; Collaborate with Platform managers on evolution roadmap.
Seniority
Senior, hands-on IC