OM Bank - Site Reliability Engineer
Core
Maintaining the OM Bank platform, providing first-line support for technical services, and managing service outages through incident management.
Role type
Site Reliability Engineer
Builds
Production-ready platform services for OM Bank
Domain
Banking / Cloud Infrastructure
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Kubernetes cluster management, Infrastructure as Code (Terraform, AWS CDK), Datadog observability, Microservices architecture, Python/Go programming, GitOps, AWS cloud architecture, Event streaming (Kafka), Queuing systems (SQS)
Preferred skills
Feature flagging management, Service Level Objectives definition, Self-service automation design
Technologies
Kubernetes, Terraform, AWS, Datadog, Python, Go, Helm Charts, Kafka, SQS
Responsibilities
Managing incident detection, triaging, and resolution; maintaining production readiness scorecards; creating and tuning Datadog monitors and dashboards; designing automation initiatives to reduce MTTR; advising on engineering best practices for observability and scalability; maintaining SRE API and platform health metrics.
Seniority
Senior, hands-on IC