CareerPlanSign in

多模态大模型推理框架优化工程师-Data AML(北京/上海/杭州/深圳)

北京💼 Full-time🗓 2026-09-28

Core

End-to-end performance optimization of SOTA multimodal model inference chains (Seedance, Seedream, Seed3D) focusing on GPU utilization, throughput, latency, and memory efficiency.

Role type

Senior IC inference framework optimization engineer

Builds

High-performance inference services for multimodal (VLM), video generation (DiT/VAE), and MoE models

Domain

AI Infrastructure / GPU Systems / Multimodal AI

Deliverable

production ML models

Required skills

C++ or Python, GPU architecture expertise, Transformer inference knowledge, performance profiling, system-level optimization

Preferred skills

Multi-GPU communication optimization, cross-hardware adaptation, Kubernetes/Docker, video generation model acceleration

Technologies

C++, Python, GPU clusters, Kubernetes, Docker, TP/PP/EP

Responsibilities

Optimize inference latency and throughput for SOTA models; Design and optimize multi-card communication strategies (TP/PP/EP); Adapt inference strategies to new GPU hardware architectures; Develop scalable acceleration solutions for diverse model architectures; Research and implement cutting-edge inference acceleration technologies.

Sourced via bytedance · Listed on CareerPlan, which tracks 853,000+ jobs from 20+ sources.