CareerPlanSign in

光子 AI-推理部署与优化研究员

Shenzhen, China💼 Full-time🗓 2026-09-28

Core

Optimizing inference efficiency and latency for diffusion-based video models on consumer-grade GPUs to enable efficient on-device generation.

Role type

Senior IC AI inference systems engineer (video/diffusion)

Builds

High-concurrency inference services, end-to-end low-latency pipelines, and real-time streaming protocols for video generation.

Domain

AI systems, video processing, real-time streaming

Deliverable

production ML models

Required skills

Diffusion model inference optimization, TensorRT/vLLM, model quantization/pruning/distillation, video codec principles, ffmpeg, hardware-accelerated codecs, real-time streaming protocols, CUDA operator optimization, FlashAttention/FlashInfer

Preferred skills

Cloud gaming system optimization, speculative diffusion sampling, training-inference unification, MLSys/ASPLOS/OSDI/NeurIPS publications

Responsibilities

Optimize inference efficiency for diffusion-based video models; optimize inference pipelines for consumer GPUs; design high-concurrency services with model routing and canary releases; build end-to-end low-latency pipelines with hardware-accelerated encoding/decoding; develop efficient video encoding configurations for real-time streaming; track and implement latest acceleration methods like speculative sampling.

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.