混部调度研发工程师/架构师
Core
Designing and developing a unified scheduling system for a massive container cloud platform to co-locate offline big data and ML training workloads with online services, optimizing resource utilization and performance isolation.
Role type
Senior IC distributed systems engineer (scheduling & container orchestration)
Builds
A multi-tenant, multi-scenario container cloud platform supporting online, offline, ML, and recommendation/ad/search applications for products like Toutiao, Douyin, and Xigua Video.
Domain
Cloud infrastructure, container orchestration, big data, machine learning
Deliverable
production ML models
Required skills
Scheduling algorithms, Kubernetes internals, C++/Go/Java, Container runtime (Docker/Containerd), Kernel tuning (Cgroup/CFS), System performance analysis, Data modeling
Preferred skills
Cgroup v2, IOCost, Complex system debugging, Infrastructure optimization
Responsibilities
Architecting core scheduling solutions for mixed deployment and tidal resource allocation; Solving multi-tenant resource coordination and performance isolation; Enhancing scheduling intelligence via data and ML algorithms; Analyzing data to identify optimization opportunities; Driving technology adoption across diverse business scenarios.