Site Reliability Engineer
Core
Hybrid role combining Technical Support Engineer and Site Reliability Engineering to ensure reliability, scalability, and performance of an AI-powered public SaaS platform for AI inference.
Role type
Hybrid Technical Support Engineer / Site Reliability Engineer
Builds
AI Security SaaS platform for running AI inference across distributed architectures
Domain
Cloud-native AI Security / SaaS
Deliverable
production ML models | product features | dashboards & analysis
Required skills
Python, Bash, Terraform, HTTP/REST/JSON, Linux administration, PostgreSQL, cloud operations, incident management, SLO monitoring, root cause analysis, automation scripting
Preferred skills
Kubernetes, Prometheus, Grafana, SRE principles, Ansible, Chef, Puppet
Technologies
AWS, Google Cloud, OpenStack, Terraform, Python, Bash, PostgreSQL, Prometheus, Grafana, Kubernetes, Ansible, Chef, Puppet
Responsibilities
Monitor system behaviors and ensure SLOs via observability tools; manage 24/7 incident response and postmortems; troubleshoot complex customer-facing technical issues; build automated workflows using IaC and scripting; collaborate with engineering teams to improve system design and reliability; drive continuous service improvement and security-as-code integration.
Seniority
Mid-level, hands-on IC