CareerPlanSign in

监控系统研发(J102503)

北京市💼 Full-time🗓 2026-07-21 → 2026-09-28

Core

Design and implement end-to-end observability for large-scale data center networks (including GPU clusters), focusing on intelligent fault detection, root cause analysis, and automated remediation to support high-SLA AI training and inference workloads.

Role type

Senior IC Network Observability Engineer (AI Infra)

Builds

High-throughput, low-latency monitoring platforms covering physical to application layers for GPU clusters and traditional clusters.

Domain

Data Center Networking + AI Infrastructure

Deliverable

production ML models | product features

Required skills

Network protocol analysis (SNMP, Telemetry, NetFlow), Stream processing (Kafka, Flink), Time-series databases (ClickHouse, VictoriaMetrics), RDMA stack (RoCEv2, InfiniBand, PFC, ECN), GPU cluster networking (NCCL, HCCL), Python/Go/Java/C++/Rust, Linux, Docker/K8s.

Preferred skills

AI model-assisted coding, Experience with H100/H800/A100/A800 clusters, AI network trend tracking.

Responsibilities

Architect network monitoring platforms, design intelligent fault perception systems, build data processing pipelines, construct monitoring dashboards, implement RDMA metric collection, design alerting strategies, develop automated self-healing capabilities.

Seniority

Mid-level, hands-on IC

Sourced via baidu · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.