Site Reliability Engineer (req-307)
Core
Manage, monitor, and optimize Kubernetes clusters and cloud infrastructure to ensure reliability and scalability for clients' digital transformation and AI solutions.
Role type
Site Reliability Engineer (SRE)
Builds
Scalable, data-driven AI solutions and microservices on Kubernetes
Domain
Cloud Infrastructure & Kubernetes
Deliverable
production ML models | infrastructure
Required skills
Kubernetes, Cloud Infrastructure, Infrastructure as Code (IaC), Containerization, Monitoring & Incident Response, Automation, Security & Compliance
Preferred skills
Deep learning, natural language processing, computer vision, reinforcement learning
Technologies
Kubernetes, Docker, Terraform, CloudFormation, AWS, Azure, GCP, Jenkins, Linux, Ansible, Helm, PostgreSQL, NFS, HDFS, Ceph, Amazon S3, Apache Mesos, Yarn, Python, Java, C/C++, Ruby, JavaScript
Responsibilities
Monitor and manage Kubernetes clusters for stability and scalability; Deploy and scale applications using Helm charts and manage services; Design and maintain Docker-based microservices architecture; Configure and manage cloud infrastructure resources using IaC; Set up monitoring solutions and manage incident response; Build automation tools for infrastructure scaling and maintenance; Ensure systems follow security and compliance best practices.
Seniority
Mid-level, hands-on IC
