Staff Observability Engineer
Core
Design, build, and mature the observability ecosystem for a mobile gaming platform, combining system telemetry with user signals to provide holistic visibility into performance, reliability, and user experience.
Role type
Staff Observability Engineer
Builds
Scalable observability capabilities, intelligent alerting, anomaly detection, and root cause analysis tooling for a mobile gaming platform.
Domain
Mobile gaming / Distributed systems observability
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Observability engineering, SRE, platform engineering, Datadog, Kubernetes, AWS, Terraform, Go/Java/Python/TypeScript, SLO/SLI definition, distributed systems principles, automation, stakeholder influence
Preferred skills
AI/ML for observability, incident management strategy, cross-team leadership, cost optimization
Technologies
AWS, Kubernetes, Terraform, Helm, Ansible, Vault, Datadog, PagerDuty
Responsibilities
Define and drive observability strategy and roadmap; Design scalable observability capabilities; Establish best practices for monitoring, alerting, and incident management; Drive operational excellence in on-call and postmortem processes; Lead cross-team initiatives for end-to-end reliability; Leverage automation and AI to accelerate root cause analysis; Mentor engineers to raise organizational maturity.
Seniority
Staff, hands-on IC with strategic influence