CareerPlanSign in

Site Reliability Engineer - Machine Learning

USA💼 Full-time💰 $61,000–$61,000🗓 2026-09-09 → 2026-09-26

Core

Build and maintain the reliability of mission-critical financial applications and services using SRE principles and enterprise-authorized AI capabilities.

Role type

Senior Site Reliability Engineer (Machine Learning)

Builds

Automated CI/CD pipelines, infrastructure-as-code, and AI-assisted operational workflows for banking platforms.

Domain

Financial Services / Cloud Infrastructure / AI Operations

Deliverable

production ML models | infrastructure | product features

Required skills

Site Reliability Engineering (SRE) culture, Python, Java/Spring Boot or .NET, observability (white/black-box monitoring, SLOs), CI/CD tooling, container orchestration, networking troubleshooting, data sensitivity handling, AI output validation.

Preferred skills

Data/compute workflow orchestration (Airflow, AWS Step Functions), Databricks operations, Infrastructure-as-Code (Terraform), GitOps (Argo CD, Flux), OpenTelemetry, AWS certification.

Technologies

Airflow, AWS, Databricks, Terraform, Argo CD, Flux, OpenTelemetry, Spring Boot, .NET, Python, REST API

Responsibilities

Guide teammates in embedding SRE best practices and designing reliability approaches; collaborate on automated CI/CD pipelines; use AI to speed up incident triage and post-incident analysis while validating outputs; implement infrastructure and network as code; resolve complex issues using SLOs; apply AI to spot reliability risks and prioritize improvements; proactively identify blockers and evaluate new technologies.

Seniority

Senior, hands-on IC

Sourced via devitjobs · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.