CareerPlanSign in

Machine Learning Engineer

México💼 Full-time🗓 2026-08-27 → 2026-09-07

Core

Configure, maintain, and monitor distributed ML training workloads across multi-node accelerator clusters.

Role type

ML Operations Engineer

Builds

Distributed ML training pipelines on accelerator clusters

Domain

Cloud Infrastructure & Machine Learning

Deliverable

infrastructure

Required skills

Kubernetes, Docker, Linux command-line, Python scripting, Bash scripting, distributed workload monitoring, log analysis, configuration management

Preferred skills

None stated

Technologies

Kubernetes, Docker, YAML

Responsibilities

Configure and maintain ML environments using Kubernetes, Docker, and YAML-based configurations; Execute, monitor, and validate distributed ML training workloads across multi-node accelerator clusters; Review, modify, and execute Python and Bash scripts to automate workload execution and adjust runtime configurations; Troubleshoot workload failures, collect logs, identify infrastructure or configuration issues, and document findings; Track workload execution status, communicate test progress, and collaborate with engineering teams to improve reliability and operational efficiency.

Sourced via adzuna · Listed on CareerPlan, which tracks 70,000+ jobs from 20+ sources.