AI-Infra开发工程师(可观测/运维平台方向)(J99647)
Core
Build a unified observability data foundation and an AI-driven AIOps platform to enable automated monitoring, diagnosis, and resource governance for large-scale distributed systems.
Role type
Senior IC AI Infrastructure Engineer (Observability & AIOps)
Builds
Unified observability data platform, AI-Agent driven AIOps capabilities, and intelligent resource scheduling systems
Domain
Cloud Infrastructure, Distributed Systems, AI/ML Operations
Deliverable
production ML models
Required skills
Go, Python, Java, Linux/OS fundamentals, Network protocols, Data structures, Distributed systems architecture, AI/ML integration, Agent-based system design, Resource scheduling
Preferred skills
Large language model (LLM) application, Anomaly detection algorithms, Heterogeneous computing (CPU/GPU) management, Automated root cause analysis
Technologies
Tracing, Metrics, Logging, Rule engines, Skill/Plugin frameworks, Container orchestration
Responsibilities
Design and implement automated O&M loops (inspection, diagnosis, root cause, remediation), Develop AI-Agent driven AIOps capabilities, Integrate LLMs for intelligent analysis and auto-diagnosis, Build unified resource observation and scheduling for heterogeneous workloads, Ensure platform stability through capacity planning and performance optimization