混元大语言模型后训练算法工程师(深圳/北京/上海)
Core
Develop and optimize post-training algorithms for large language models, focusing on reward modeling, RLHF, personalization, and long-term memory mechanisms to enhance instruction following, reasoning, and user alignment.
Role type
Senior IC machine-learning engineer (LLM post-training)
Builds
Production LLMs with improved alignment, personalization, and memory capabilities
Domain
Artificial Intelligence / Large Language Models
Deliverable
production ML models
Required skills
Reward Modeling, RLHF, Transformer architecture, Python, PyTorch, distributed training, Megatron-LM, DeepSpeed, vLLM, data synthesis (SFT, Self-Instruct), evaluation metrics
Preferred skills
Personalized LLMs, Memory/RAG mechanisms, user profiling, recommendation systems, long-context optimization, NeurIPS/ICLR/ICML/ACL/EMNLP publications, HuggingFace contributions