CareerPlanSign in

语音算法工程师(多模态理解大模型-说话人方向) - Data语音

北京💼 Full-time🗓 2026-09-28

Core

Building speaker-related capabilities for multimodal audio understanding large models (ALM) and solving frontier technical challenges in deployment.

Role type

Senior IC machine-learning engineer (speaker diarization & multimodal audio understanding)

Builds

Multimodal audio understanding base models and speaker-related features for products like DouBao, TikTok, CapCut, and enterprise services via Volcengine.

Domain

AIGC, Large Language Models, Audio Processing, Speaker Diarization

Deliverable

production ML models

Required skills

Speaker diarization, Speaker verification, Speaker clustering, Speech recognition, Audio captioning, Multimodal understanding, Deep learning (AHC, ResNet, EcapaTDNN, ALM, LLM), Industrial-scale data pipelines, C++, Python, Code Agents (Codex, TRAE)

Preferred skills

Speaker diarization in meeting/hardware scenarios, End-to-end speaker diarization optimization, Open source contributions in speaker diarization, Publications in ICASSP/Interspeech/ASRU/IEEE/ACM, Competitive programming awards (ACM/NOI/IOI/TopCoder)

Responsibilities

Build speaker-related capabilities for ALM post-training, Participate in core technology construction of next-gen multimodal audio understanding base models, Optimize technical effects and solve deployment challenges.

Seniority

Senior, hands-on IC

Sourced via bytedance · Listed on CareerPlan, which tracks 844,000+ jobs from 20+ sources.