光子 AI-推理部署与优化研究员
Core
Optimizing inference efficiency and latency for diffusion-based video models on consumer-grade GPUs to enable efficient on-device generation.
Role type
Senior IC AI inference systems engineer (video/diffusion)
Builds
High-concurrency inference services, end-to-end low-latency pipelines, and real-time streaming protocols for video generation.
Domain
AI systems, video processing, real-time streaming
Deliverable
production ML models
Required skills
Diffusion model inference optimization, TensorRT/vLLM, model quantization/pruning/distillation, video codec principles, ffmpeg, hardware-accelerated codecs, real-time streaming protocols, CUDA operator optimization, FlashAttention/FlashInfer
Preferred skills
Cloud gaming system optimization, speculative diffusion sampling, training-inference unification, MLSys/ASPLOS/OSDI/NeurIPS publications
Responsibilities
Optimize inference efficiency for diffusion-based video models; optimize inference pipelines for consumer GPUs; design high-concurrency services with model routing and canary releases; build end-to-end low-latency pipelines with hardware-accelerated encoding/decoding; develop efficient video encoding configurations for real-time streaming; track and implement latest acceleration methods like speculative sampling.
Seniority
Senior, hands-on IC