Lead DevOps / Observability Engineer
Core
Lead the end-to-end migration of a client's observability stack from New Relic and Datadog to an open-source stack (Grafana, Prometheus, Loki, Tempo) involving infrastructure deployment and application instrumentation.
Role type
Lead DevOps / Observability Engineer
Builds
Production observability platform (metrics, logs, traces) and migration deliverables for client services
Domain
Cloud Infrastructure (AWS) + Observability Engineering
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Grafana, Prometheus, Loki, Tempo, Terraform, AWS (EKS, Kubernetes), Docker, CI/CD (GitHub Actions), full-stack application instrumentation, security remediation
Preferred skills
New Relic/Datadog migration experience, LGTM ecosystem, AWS certifications, RDS, consulting experience
Technologies
Grafana, Prometheus, Loki, Tempo, Terraform, AWS, EKS, Kubernetes, Docker, GitHub Actions, Codex
Responsibilities
Lead migration of monitoring, alerting, and dashboards; Design target observability architecture; Audit existing dashboards/alerts for parity; Modify application code for instrumentation; Deploy tooling on AWS EKS/Kubernetes; Configure AWS networking (VPC, IAM); Contribute to CI/CD pipelines; Coordinate cross-team cutover; Remediate security issues; Document architecture and procedures
Seniority
Senior, hands-on IC with leadership scope