Observability Engineer
Core
Design and build scalable observability capabilities to provide engineering teams with clear insight into application health, platform performance, and user-impacting issues.
Role type
Senior Observability Engineer (SRE/Infrastructure)
Builds
Scalable collection pipelines for metrics, logs, and traces; automated monitoring configurations and dashboards.
Domain
Financial services / Cloud Infrastructure / Observability
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Observability platform administration (Datadog), Python programming, distributed systems architecture, containerized workloads, incident management, root cause analysis, automation scripting, alerting strategy, telemetry solution design.
Preferred skills
Experience with high-availability production environments, global team collaboration, self-service guidance creation.
Technologies
Datadog, Python, Cloud environments, Containers
Responsibilities
Design observability capabilities for application health and platform performance; Build scalable collection pipelines for metrics, logs, and traces; Develop actionable alerting standards to reduce noise; Partner with teams to define service health indicators; Automate monitoring configuration and dashboard deployment; Analyze production incidents to identify telemetry gaps.
Seniority
Senior, hands-on IC