CareerPlanSign in

微信小程序-大模型评测工程师-智能体方向

Guangzhou, China💼 Full-time🗓 2026-09-28

Core

Design quality evaluation methodologies and quantifiable metrics for WeChat Mini Program agents; build datasets and benchmarks to track quality evolution and inform rule setting.

Role type

Senior IC LLM/Agent evaluation engineer (WeChat Mini Program)

Builds

Evaluation datasets, benchmarks, and quantifiable metrics for agent quality

Domain

AI/LLM evaluation, WeChat Mini Program ecosystem

Deliverable

production ML models

Required skills

LLM/Agent architecture understanding, multi-turn interaction analysis, tool calling/MCP evaluation, planning and reasoning assessment, LLM-as-Judge implementation, statistical analysis, significance testing, benchmark construction

Preferred skills

Experience with evaluation scaffolds, deep reading of LLM/alignment papers

Technologies

LLM-as-Judge, MCP, benchmarking frameworks

Responsibilities

Design evaluation methodologies for Mini Program agents; establish quantifiable and trackable metric systems; build and maintain evaluation datasets and benchmarks; analyze quality evolution trends and output research conclusions

Seniority

Senior, hands-on IC

Sourced via tencent · Listed on CareerPlan, which tracks 844,000+ jobs from 20+ sources.