多模态大模型应用研究员(多媒体方向)-视频与边缘
Core
Research and optimize multimodal large models for multimedia applications including video understanding, quality evaluation, processing, enhancement, and compression.
Role type
Senior IC multimodal large model application researcher (video & edge)
Builds
Multimodal large model algorithms deployed in image-text, VOD, and live streaming business scenarios
Domain
Multimedia, Computer Vision, Large Language Models
Deliverable
production ML models
Required skills
Diffusion models, LLMs, large model training and tuning, Computer Vision algorithms, GANs, VAEs, video AIGC
Preferred skills
NLP algorithms, Reinforcement Learning, Transformer architectures, BERT, GPT, top-tier conference publications (NeurIPS, ICLR, ICML)
Technologies
Diffusion, LLM, GAN, VAE, Transformer, BERT, GPT
Responsibilities
Develop multimodal algorithms for video understanding and enhancement; Optimize model performance and acceleration; Deploy models in multimedia business scenarios; Conduct frontier academic research and publish in top venues