Site Reliability Engineer
Core
Maintain and improve uptime and availability for RingCentral's agentic voice AI portfolio (AIR, AVA, ACE) serving businesses globally.
Role type
Senior Site Reliability Engineer (SRE)
Builds
High-complexity, AI-powered business communications platform at massive scale (millions of users)
Domain
Telecommunications / AI / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Linux administration, Kubernetes, message queuing (Kafka), SQL/NoSQL databases, cloud platforms, configuration management, incident response, capacity planning, observability integration
Preferred skills
Python, JavaScript, Java, Bash, Go, IaaC (Ansible, Terraform), GitOps (ArgoCD), CI/CD (GitLab CI, Jenkins), Nginx Proxy, AI/LLM technologies
Technologies
AWS, Azure, GCP, Prometheus, Grafana, Alertmanager, Zabbix, ELK stack, VictoriaMetrics, MongoDB, PostgreSQL, MySQL, GitLab, Jenkins, Nginx
Responsibilities
Integrate monitoring solutions into SDLC, design redundancy and failover mechanisms, conduct risk assessments, respond to incidents and outages, manage capacity in growing environments, extend observability across codebases, participate in global incident resolution
Seniority
Senior, hands-on IC