Senior Site Reliability Engineer (Noida, BLR, India)
Core
Senior SRE focused on infrastructure cost efficiency (FinOps), GPU throughput optimization, and reliability instrumentation for an AI-native customer experience platform.
Role type
Senior Site Reliability Engineer (FinOps & GPU Infrastructure)
Builds
AI Agents, customer-facing agents, agent-assist, backend automation, and conversation analytics.
Domain
Artificial Intelligence / Customer Experience (CX) / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Kubernetes at scale, Python, Go/Rust, GCP, Terraform, CI/CD, GPU workload optimization, observability, FinOps
Preferred skills
None stated
Technologies
Kubernetes, GCP, Terraform, Cast AI, Karpenter
Responsibilities
Reduce Kubernetes overprovisioning and drive right-sizing programs; run experimentation programs on on-premise GPU clusters; build tooling and dashboards for backend teams to own cost/reliability budgets; ensure proper reliability instrumentation for cost-at-scale; execute selective security workstreams.
Seniority
Senior, hands-on IC