Senior Software Engineer - Observability and Reliability
Core
Build observability tools and platforms (metrics, logging, distributed tracing, dashboarding, alerting, APM) to make data easily accessible and ensure service uptime.
Role type
Senior Software Engineer (Observability & Reliability)
Builds
Observability tools, platforms, and runtime processes for cloud triaging
Domain
Cloud infrastructure, distributed systems, observability
Deliverable
production ML models | product features | infrastructure
Required skills
Go, Open Telemetry, Kubernetes, distributed systems, cloud infrastructure administration, product mindset, code reviews
Preferred skills
Data analytics systems, distributed systems monitoring, cloud application security, startup experience
Technologies
Go, Open Telemetry, Kubernetes, GCP, AWS, Azure
Responsibilities
Build observability tools and platforms; Participate in on-call rotation; Create runtime tools to optimize cloud triaging; Define best practices for system measurability; Collaborate on design and code reviews
Seniority
Senior, hands-on IC