Senior Site Reliability Engineer
Core
Operate and maintain Develocity instances and supporting services for paying customers, open-source projects, and public-facing services, ensuring reliability, performance, and availability.
Role type
Senior Site Reliability Engineer (Founding Member)
Builds
Develocity toolchain observability and intelligence platform, artifact registries, and internal Cloud Application Platform
Domain
SaaS, Cloud Infrastructure, Kubernetes, Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes production operations, AWS cloud infrastructure, observability tools (Prometheus, Grafana), Infrastructure as Code (Terraform), incident management, SRE best practices (SLAs/SLOs), scripting (Python, Bash), automation
Preferred skills
SaaS platform operations at scale, Develocity familiarity, JVM languages (Java, Kotlin), disaster recovery planning, customer-facing incident communication, establishing SRE practices in new teams
Technologies
Kubernetes, AWS (EKS, RDS, S3, EC2), Prometheus, Grafana, Terraform, Python, Bash, Develocity
Responsibilities
Operate and maintain Develocity instances and supporting services; Participate in follow-the-sun on-call rotation for incident response; Drive automation for deployment, upgrades, monitoring, self-healing, and recovery; Build and maintain observability (logging, metrics, tracing, alerting); Work with engineering teams to build reliability into features; Run incident response and retrospectives; Own disaster recovery, backups, and business continuity; Optimize performance, resource usage, and costs; Help evolve SaaS operations as the company grows
Seniority
Senior, hands-on IC (Founding Member)