微信-WeLM 大模型 RL 环境构建研发工程师(深圳、上海)
Core
Design and implement isolated sandbox environments for executing RL agent code, APIs, and multi-step reasoning to support large model iteration.
Role type
Senior IC RL environment engineering specialist
Builds
Isolated execution sandboxes, interaction protocols, and automated evaluation benchmarks for LLM agents
Domain
AI/ML (Reinforcement Learning) + Systems Engineering
Deliverable
production ML models
Required skills
Python/Go/C++, Linux, containerization, ReAct/AutoGPT/LangChain/AutoGen, debugging complex dependencies
Preferred skills
RLHF/RLAIF research, environment feedback mechanisms
Technologies
Docker, WebAssembly, VM
Responsibilities
Design and implement isolated sandbox environments for RL execution; Optimize Observation/Action loops for tool calling accuracy; Build automated evaluation benchmarks for specific scenarios; Research environment feedback mechanisms for model iteration
Seniority
Senior, hands-on IC
