多模态大模型推理算子优化工程师-Data AML(北京/上海/杭州/深圳)
Core
Optimize inference acceleration for Seedance/Seedream foundation models and derivatives across heterogeneous hardware.
Role type
Senior IC multi-modal large model inference operator optimization engineer
Builds
High-performance inference engines for video/image generation and multi-modal models
Domain
AI Infrastructure / Heterogeneous Computing / AIGC
Deliverable
production ML models
Required skills
CUDA/AscendC/BangC/HIP operator optimization, FlashAttention, Conv2d, Matmul, GroupedMatmul, MOE implementation, low-bit quantization, sparsity optimization, Triton, TileLang, Cute DSL, TensorRT-LLM, SGLang, vLLM, ZeRO, TP, SP parallelism
Preferred skills
AIGC model training adaptation, compute/communication fusion, heterogeneous hardware adaptation
Responsibilities
Implement and accelerate compute-intensive operators for multi-modal models, adapt models to heterogeneous hardware architectures
Seniority
Senior, hands-on IC