Site Reliability Engineering Technical Leader (Remote)
Core
Designing, developing, testing, and deploying advanced AI-driven software features for data center networks to support Cisco Engineering and business functions worldwide.
Role type
Senior IC Site Reliability Engineering Technical Leader (AI/ML Networking)
Builds
Scalable, reliable networking solutions for AI/ML infrastructure and high-performance computing
Domain
Data Center Networking, AI/ML Infrastructure, High-Performance Computing
Deliverable
production ML models | infrastructure
Required skills
Cisco Data Center Networking technologies, ACI networks, Routing, Switching, Nexus, VPC, VDC, VLAN, VXLAN, BGP, GPU cluster management, AI-based observability tools, Terraform, Ansible, software engineering concepts, distributed computing, cloud computing paradigms, AI Fabric and Networking
Preferred skills
Build & Release Operations, DevOps principles, Agile practices, Unix/Linux environments, application/platform instrumentation, log data processing, monitoring tools (JIRA, GIT, Jenkins), Cisco Nexus Dashboard, APIC, Nexus Dashboard Fabric Controller
Technologies
Terraform, Ansible, Cisco Nexus, Cisco APIC, Cisco Nexus Dashboard Fabric Controller, JIRA, GIT, Jenkins
Responsibilities
Designing and deploying advanced AI-driven software features for data center networks, driving strategic automation initiatives, managing networking for GPU cluster environments, implementing AI-based observability tools, creating documentation and training materials, resolving hardware/software interoperability issues
Seniority
Senior, hands-on IC with leadership responsibilities