音频大模型算法专家 - 音视频技术
Core
Designing and developing streaming audio large models for unified multi-task modeling (ASR, speaker diarization, emotion analysis, audio QA) and advancing audio generation capabilities.
Role type
Senior IC machine-learning engineer (audio large models)
Builds
Industry-leading audio understanding and generation capabilities for internal products and external cloud services
Domain
Audio signal processing and large language models
Deliverable
production ML models
Required skills
Audio signal processing, deep learning frameworks (PyTorch/TensorFlow), audio representation modeling, Python/C++ programming, cross-modal attention mechanisms, model fine-tuning (SFT/RLHF/DPO)
Preferred skills
Large-scale audio dataset construction, model compression/quantization/deployment, top-tier conference publications (ICML/NeurIPS/ICASSP), psychoacoustics background, TTS/audio generation model experience