微信小程序-大模型评测工程师-智能体方向
Core
Design quality evaluation methodologies and quantifiable metrics for WeChat Mini Program agents; build datasets and benchmarks to track quality evolution and inform rule setting.
Role type
Senior IC LLM/Agent evaluation engineer (WeChat Mini Program)
Builds
Evaluation datasets, benchmarks, and quantifiable metrics for agent quality
Domain
AI/LLM evaluation, WeChat Mini Program ecosystem
Deliverable
production ML models
Required skills
LLM/Agent architecture understanding, multi-turn interaction analysis, tool calling/MCP evaluation, planning and reasoning assessment, LLM-as-Judge implementation, statistical analysis, significance testing, benchmark construction
Preferred skills
Experience with evaluation scaffolds, deep reading of LLM/alignment papers
Technologies
LLM-as-Judge, MCP, benchmarking frameworks
Responsibilities
Design evaluation methodologies for Mini Program agents; establish quantifiable and trackable metric systems; build and maintain evaluation datasets and benchmarks; analyze quality evolution trends and output research conclusions
Seniority
Senior, hands-on IC