Senior Systems Reliability Engineer
Core
Optimizing and automating processes and systems to improve reliability, scalability, and maintainability for a trading platform, including real-time monitoring, incident management, and recovery.
Role type
Senior Systems Reliability Engineer
Builds
Trading platform infrastructure and monitoring automation tools
Domain
Capital markets / High-performance computing
Deliverable
production ML models | product features | dashboards & analysis | infrastructure
Required skills
Linux administration, Python scripting, Bash scripting, Ansible configuration management, Git version control, Host side networking, Packet capture analysis, TCP/IP stack knowledge, Multicast configuration, Data Center workflows, Hardware troubleshooting, Arista/Cisco switch CLI, Solarflare/Mellanox NICs
Preferred skills
Java, C++, Agile environment experience, Regulated environment innovation
Technologies
Python, Bash, Ansible, Git, Linux, Arista, Cisco, Solarflare, Mellanox, Corvil
Responsibilities
Responsible for technical operations of the trading platform; Build tools to monitor and automate processes; Troubleshoot issues across hardware, software, application, and network; Document configuration processes and policies; Translate customer needs to operational reliability targets; Guide other functions on reliability techniques; Educate and mentor team on operational best practices
Seniority
Senior, hands-on IC