Senior Site Reliability Engineer, Data Persistence
Core
Senior SRE ensuring reliability and scalability of Wikimedia's global infrastructure (Wikipedia) and developing data persistence solutions.
Role type
Senior Site Reliability Engineer (Data Persistence)
Builds
Wikimedia's public-facing infrastructure and data storage systems
Domain
Non-profit / Open Source / Distributed Systems
Deliverable
production ML models | product features | infrastructure
Required skills
Linux system administration, shell scripting (Python, Bash), configuration management (Puppet), distributed caching optimization, incident response, root cause analysis, automation, SLO definition
Preferred skills
Linux kernel tuning, monitoring/logging (Prometheus, Grafana), OpenStack Swift/Ceph, Cassandra/MariaDB, Bacula, MediaWiki
Technologies
Puppet, Kubernetes, Python, Go, Bash, Redis, Memcached, Prometheus, Grafana, OpenStack Swift, Ceph, Cassandra, MariaDB, Bacula, Debian, HHVM, PHP
Responsibilities
Perform operational/DevOps tasks (deployment, maintenance, troubleshooting), implement configuration management and deployment tools, lead continuous improvement automation, assist in architectural design of scalable services, participate in 24/7 on-call rotation for incident response, mentor peers
Seniority
Senior, hands-on IC with mentorship