Site Reliability Engineering Intern
Core
Support production readiness, stability, and resilience for business operations products through operational design, automation, and monitoring.
Role type
Site Reliability Engineering Intern
Builds
Stable, healthy, and resilient platforms for business operations
Domain
Technology / Business Operations
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Programming/scripting (Python, Go, Bash), Linux/Unix systems, core networking, system monitoring, observability, troubleshooting, performance optimization, risk management, compliance
Preferred skills
Cloud platforms (AWS, Azure, GCP), DevOps practices, CI/CD pipelines, containers, automation tools, observability tools (Splunk, Dynatrace, Jenkins, Bitbucket, PCF)
Technologies
AWS, Azure, Bash, BitBucket, CI/CD, Cloud, DevOps, Dynatrace, GCP, Jenkins, Linux, Network, Python, Splunk, Unix
Responsibilities
Support operational design, automation, capacity planning, and monitoring; assist with daily operations including triage, root cause analysis, and blameless post-mortems; engage in development lifecycle for proactive production and change management; contribute to operations standards and foster agile culture; support risk management and compliance activities; provide feedback aligning product priorities with operational needs.