监控系统研发(J102503)
Core
Design and implement end-to-end observability for large-scale data center networks (including GPU clusters), focusing on intelligent fault detection, root cause analysis, and automated remediation to support high-SLA AI training and inference workloads.
Role type
Senior IC Network Observability Engineer (AI Infra)
Builds
High-throughput, low-latency monitoring platforms covering physical to application layers for GPU clusters and traditional clusters.
Domain
Data Center Networking + AI Infrastructure
Deliverable
production ML models | product features
Required skills
Network protocol analysis (SNMP, Telemetry, NetFlow), Stream processing (Kafka, Flink), Time-series databases (ClickHouse, VictoriaMetrics), RDMA stack (RoCEv2, InfiniBand, PFC, ECN), GPU cluster networking (NCCL, HCCL), Python/Go/Java/C++/Rust, Linux, Docker/K8s.
Preferred skills
AI model-assisted coding, Experience with H100/H800/A100/A800 clusters, AI network trend tracking.
Responsibilities
Architect network monitoring platforms, design intelligent fault perception systems, build data processing pipelines, construct monitoring dashboards, implement RDMA metric collection, design alerting strategies, develop automated self-healing capabilities.
Seniority
Mid-level, hands-on IC