Site Reliability Engineer ll (DBA)
Core
Operate and maintain high-availability distributed database systems (Vitess/Cassandra) ensuring stability, scalability, and reliability for customer-facing services.
Role type
Senior IC Site Reliability Engineer (Database Administration)
Builds
Production database clusters and operational tooling for cloud storage services
Domain
Cloud Storage / Distributed Databases
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux systems administration, SQL and NoSQL database management, MySQL performance tuning and replication, distributed systems operations, incident response, root cause analysis, scripting (Python/Bash/Go), Kubernetes/Docker, CI/CD pipelines, Infrastructure as Code (Terraform/Ansible)
Preferred skills
Vitess experience, SaaS environment experience, ITIL/OSS practices, SLO/SLA management, cloud platforms (AWS/GCP/Azure)
Technologies
Vitess, Cassandra, Kubernetes, Docker, Prometheus, Grafana, Catchpoint, ELK, FireHydrant, Terraform, Ansible, Jenkins, MySQL
Responsibilities
Operate and maintain high-availability database systems against established architecture and runbooks; optimize database performance through query tuning, indexing, and schema design; execute backup, recovery, and replication procedures; monitor service health using SLIs, SLOs, and error budgets; participate in on-call rotations, incident response, and post-incident reviews; develop automation for common operational tasks; contribute to monitoring, logging, and alerting frameworks; write scripts to improve system reliability and efficiency.
Seniority
Senior, hands-on IC
