音频大模型算法专家 - 音视频技术
Core
Designing and developing streaming audio large models for unified tasks including speech recognition, speaker diarization, emotion analysis, and audio Q&A, while enhancing speech synthesis and audio generation capabilities.
Role type
Senior IC audio large model algorithm expert
Builds
Industry-leading audio understanding and generation models for internal products (Douyin, Toutiao) and external cloud services (Volcano Engine)
Domain
Audio technology, Large Language Models (LLM), Multi-modal AI
Deliverable
production ML models
Required skills
Audio signal processing, Deep learning, PyTorch/TensorFlow, Python/C++, Model pre-training and fine-tuning, Cross-modal alignment
Preferred skills
Model compression and quantization, End-side deployment, Top-tier conference publications (ICML/NeurIPS), Acoustic engineering background, TTS/Audio generation experience
Responsibilities
Architect streaming audio large models for multi-task learning, Research real-time audio generation and encoding algorithms, Build large-scale multi-modal audio data pipelines, Fuse audio encoders with LLMs to optimize attention mechanisms, Track frontier technologies and drive SFT/RLHF/DPO for product integration