Senior Site Reliability Engineer - Security
Core
Building observability, automation, and runtime reliability for Gen AI platforms and internal agentic systems.
Role type
Senior Site Reliability Engineer (Security)
Builds
Telemetry pipelines, automated findings-to-fix loops, and hardening controls for AI systems.
Domain
Generative AI / Cloud Infrastructure
Deliverable
production ML models | infrastructure
Required skills
Python scripting, Infrastructure-as-Code (Terraform/Pulumi), observability (metrics/logs/traces), AWS logging/telemetry, CI/CD integration, incident response, secrets management, rate limiting, drift detection
Preferred skills
AI agent runtimes, prompt/tool telemetry, privacy-aware telemetry, compliance-oriented logging, MCP integration
Technologies
Python, Terraform, Pulumi, AWS, Wiz, CrowdStrike, Orca, GuardDuty, WAF, RASP, MCP
Responsibilities
Design and operate observability layers for AI platforms; Build automated findings-to-fix loops; Implement reliability and hardening controls; Codify detections and policies as code; Review platform changes for production readiness; Own AI-platform operational readiness and partner with SOC teams
Seniority
Senior, hands-on IC