Staff Site Reliability Engineer
Core
Architecting, implementing, and maintaining high-availability solutions for Visa's global payment application services, focusing on automation, incident response, and cloud-native evolution.
Role type
Staff Site Reliability Engineer (IC)
Builds
Cloud-native application services, automated deployment pipelines, and monitoring systems for billions of transactions
Domain
Payments technology, Cloud Infrastructure, Distributed Systems
Deliverable
production ML models | product features | infrastructure
Required skills
Cloud platform expertise (AWS, Azure, GCP), Containerization, Infrastructure-as-Code (Terraform, Ansible), Observability (Prometheus, Grafana, Datadog, ELK), Python, Go, Java, Distributed systems design, ML model deployment pipelines
Preferred skills
Microservices architecture, High-performance application design, Agile methodologies, 24x7 environment experience, Generative AI tool fluency
Technologies
Tomcat, Apache, Spring Boot, SQS, JBoss, IBM MQ, IBM DataPower, Hazelcast, Flink, Connect Direct, SSL, Terraform, Ansible, Prometheus, Grafana, Datadog, ELK stack, AWS, Azure, GCP
Responsibilities
Architect and implement solutions for 'Always On' availability, Automate monitoring and incident response processes, Lead investigations and troubleshooting for complex technical issues, Collaborate with global teams to deploy application services, Drive evolution to cloud-native solutions, Build and maintain documentation repositories, Participate in on-call rotations, Support and optimize ML model deployment pipelines
Seniority
Staff, hands-on IC with strategic influence