Site Reliability Engineer - Machine Learning
Core
Build and maintain the reliability of mission-critical financial applications and services using SRE principles and enterprise-authorized AI capabilities.
Role type
Senior Site Reliability Engineer (Machine Learning)
Builds
Automated CI/CD pipelines, infrastructure-as-code, and AI-assisted operational workflows for banking platforms.
Domain
Financial Services / Cloud Infrastructure / AI Operations
Deliverable
production ML models | infrastructure | product features
Required skills
Site Reliability Engineering (SRE) culture, Python, Java/Spring Boot or .NET, observability (white/black-box monitoring, SLOs), CI/CD tooling, container orchestration, networking troubleshooting, data sensitivity handling, AI output validation.
Preferred skills
Data/compute workflow orchestration (Airflow, AWS Step Functions), Databricks operations, Infrastructure-as-Code (Terraform), GitOps (Argo CD, Flux), OpenTelemetry, AWS certification.
Technologies
Airflow, AWS, Databricks, Terraform, Argo CD, Flux, OpenTelemetry, Spring Boot, .NET, Python, REST API
Responsibilities
Guide teammates in embedding SRE best practices and designing reliability approaches; collaborate on automated CI/CD pipelines; use AI to speed up incident triage and post-incident analysis while validating outputs; implement infrastructure and network as code; resolve complex issues using SLOs; apply AI to spot reliability risks and prioritize improvements; proactively identify blockers and evaluate new technologies.
Seniority
Senior, hands-on IC