语音算法工程师(多模态理解大模型-说话人方向) - Data语音
Core
Building speaker-related capabilities for multimodal audio understanding large models (ALM) and solving frontier technical challenges in deployment.
Role type
Senior IC machine-learning engineer (speaker diarization & multimodal audio understanding)
Builds
Multimodal audio understanding base models and speaker-related features for products like DouBao, TikTok, CapCut, and enterprise services via Volcengine.
Domain
AIGC, Large Language Models, Audio Processing, Speaker Diarization
Deliverable
production ML models
Required skills
Speaker diarization, Speaker verification, Speaker clustering, Speech recognition, Audio captioning, Multimodal understanding, Deep learning (AHC, ResNet, EcapaTDNN, ALM, LLM), Industrial-scale data pipelines, C++, Python, Code Agents (Codex, TRAE)
Preferred skills
Speaker diarization in meeting/hardware scenarios, End-to-end speaker diarization optimization, Open source contributions in speaker diarization, Publications in ICASSP/Interspeech/ASRU/IEEE/ACM, Competitive programming awards (ACM/NOI/IOI/TopCoder)
Responsibilities
Build speaker-related capabilities for ALM post-training, Participate in core technology construction of next-gen multimodal audio understanding base models, Optimize technical effects and solve deployment challenges.
Seniority
Senior, hands-on IC