Machine Learning Engineer
Core
Configure, maintain, and monitor distributed ML training workloads across multi-node accelerator clusters.
Role type
ML Operations Engineer
Builds
Distributed ML training pipelines on accelerator clusters
Domain
Cloud Infrastructure & Machine Learning
Deliverable
infrastructure
Required skills
Kubernetes, Docker, Linux command-line, Python scripting, Bash scripting, distributed workload monitoring, log analysis, configuration management
Preferred skills
None stated
Technologies
Kubernetes, Docker, YAML
Responsibilities
Configure and maintain ML environments using Kubernetes, Docker, and YAML-based configurations; Execute, monitor, and validate distributed ML training workloads across multi-node accelerator clusters; Review, modify, and execute Python and Bash scripts to automate workload execution and adjust runtime configurations; Troubleshoot workload failures, collect logs, identify infrastructure or configuration issues, and document findings; Track workload execution status, communicate test progress, and collaborate with engineering teams to improve reliability and operational efficiency.