DevOps / Site Reliability Engineer (SRE)
Core
Operate and maintain large-scale distributed systems on Linux and Open Source technologies, focusing on infrastructure reliability, Kubernetes, automation, and observability.
Role type
Senior DevOps / Site Reliability Engineer (SRE)
Builds
Critical production environments, scalable infrastructure, and high-availability systems
Domain
Cloud Infrastructure / DevOps / Distributed Systems
Deliverable
production ML models | infrastructure
Required skills
Linux systems administration, Kubernetes cluster management, CI/CD implementation, observability and logging solutions, relational and non-relational database administration, Bash and Python scripting, Docker, TCP/IP networking protocols
Preferred skills
RabbitMQ or Kafka, Java, Puppet, Ansible, ArgoCD, GitLab CI, Azure cloud technologies, Golang, Rancher
Technologies
Linux, Kubernetes, MySQL, PostgreSQL, Apache, Nginx, Jenkins, Elasticsearch, Kibana, Prometheus, Grafana, Redis, MongoDB, Docker, GitHub Copilot Business
Responsibilities
Administer Linux-based distributed systems, manage on-premises Kubernetes clusters, implement and maintain DevOps automation tools, monitor and optimize production systems, support CI/CD practices, administer database platforms, maintain observability solutions, contribute to scalability and high availability initiatives, participate in on-call rotations
Seniority
Senior, hands-on IC