Member of Technical Staff, AI Reliability & Monitoring Engineering Lead
Core
Define, build, and maintain infrastructure and processes ensuring reliability, scalability, and performance of Postman's AI-powered API and agentic systems in production.
Role type
Senior IC AI Systems Reliability Engineer (SRE)
Builds
High-availability AI infrastructure, observability systems, and automated incident response tools for API and agentic platforms.
Domain
Cloud infrastructure, AI/ML systems, API platforms
Deliverable
production ML models | infrastructure
Required skills
AI reliability engineering, SRE, distributed systems, SLO definition, observability, incident response automation, GPU/xPU optimization, cloud platforms, resource utilization optimization
Preferred skills
API platform operations, building observability tools for agentic systems, open-source contributions
Technologies
GPU/xPU, cloud platforms, monitoring tools
Responsibilities
Develop and manage reliability metrics (SLOs) for AI-driven API services; Implement comprehensive observability and monitoring systems; Design automated failover and recovery strategies; Optimize GPU/accelerator efficiency; Lead internal tooling and automation for AI system stability; Drive continuous improvement in deployment and incident management practices.
Seniority
Senior, hands-on IC