大模型/Agent评测工程师-剪映
Core
Build and maintain a general evaluation system for large models and Agents, including standards, datasets, and capability analysis to diagnose issues in reasoning, planning, tool use, and code execution.
Role type
Senior IC large model/Agent evaluation engineer
Builds
Evaluation frameworks, tools, and platforms for model/Agent assessment
Domain
Artificial Intelligence / Large Language Models / Agent Systems
Deliverable
production ML models
Required skills
Large model principles and capabilities, Agent evaluation methods, engineering design and implementation, data analysis and diagnosis, technical judgment
Preferred skills
LLM-as-a-Judge experience, complex business scenario deployment, multi-agent system design, open-source contributions
Technologies
Large Language Models, Agent frameworks, Evaluation benchmarks
Responsibilities
Design and implement evaluation frameworks and tools; Analyze evaluation results to diagnose model/Agent performance issues; Track industry trends and innovate evaluation methodologies; Collaborate with algorithm and product teams to drive evaluation system adoption.
