CareerPlanSign in

微信-WeLM 大模型 RL 环境构建研发工程师(深圳、上海)

Beijing, China💼 Full-time🗓 2026-09-28

Core

Design and implement isolated sandbox environments for executing RL agent code, APIs, and multi-step reasoning to support large model iteration.

Role type

Senior IC RL environment engineering specialist

Builds

Isolated execution sandboxes, interaction protocols, and automated evaluation benchmarks for LLM agents

Domain

AI/ML (Reinforcement Learning) + Systems Engineering

Deliverable

production ML models

Required skills

Python/Go/C++, Linux, containerization, ReAct/AutoGPT/LangChain/AutoGen, debugging complex dependencies

Preferred skills

RLHF/RLAIF research, environment feedback mechanisms

Technologies

Docker, WebAssembly, VM

Responsibilities

Design and implement isolated sandbox environments for RL execution; Optimize Observation/Action loops for tool calling accuracy; Build automated evaluation benchmarks for specific scenarios; Research environment feedback mechanisms for model iteration

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 844,000+ jobs from 20+ sources.