多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)
Core
End-to-end performance optimization of SOTA multimodal model inference chains (Seedance, Seedream, Seed3D) focusing on GPU utilization, throughput, latency, and memory efficiency.
Role type
Senior IC inference framework optimization engineer
Builds
High-performance inference services for multimodal (VLM), video generation (DiT/VAE), and MoE models
Domain
AI Infrastructure / GPU Systems / Multimodal AI
Deliverable
production ML models
Required skills
C++ or Python, GPU architecture expertise, Transformer inference knowledge, performance profiling, system-level optimization
Preferred skills
Multi-GPU communication optimization, cross-hardware adaptation, Kubernetes/Docker, video generation model acceleration
Technologies
C++, Python, GPU clusters, Kubernetes, Docker, TP/PP/EP
Responsibilities
Optimize inference latency and throughput for SOTA models; Design and optimize multi-card communication strategies (TP/PP/EP); Adapt inference strategies to new GPU hardware architectures; Develop scalable acceleration solutions for diverse model architectures; Research and implement cutting-edge inference acceleration technologies.