微信-语音全双工对话大模型预训练算法工程师
Core
Design and pretrain large-scale full-duplex conversational voice models enabling real-time interruption, natural turn-taking, and continuous dialogue.
Role type
Senior IC machine-learning engineer (full-duplex voice LLM)
Builds
Production-ready full-duplex voice dialogue models and audio understanding/generation systems
Domain
Consumer technology / Speech AI / Large Language Models
Deliverable
production ML models
Required skills
Full-duplex voice dialogue model pretraining, Audio LLM development, Audio understanding model pretraining, Audio generation model pretraining, Turn-taking modeling, End-of-turn detection, User interruption handling, Overlapping speech processing, Backchannel modeling, Streaming generation, Audio Encoder architecture, Conformer architecture, Transformer architecture, Audio Tokenization, Neural Codec, Autoregressive modeling, Diffusion modeling, Flow Matching, PyTorch, Large-scale distributed training, DeepSpeed, Megatron-LM, FSDP
Preferred skills
Experience with Speech-to-Speech models, Omni Model research, Experimental design, Cross-functional collaboration
Technologies
PyTorch, DeepSpeed, Megatron-LM, FSDP, Conformer, Transformer, Neural Codec, Diffusion, Flow Matching
Responsibilities
Design and pretrain full-duplex conversational voice model architectures; Pretrain audio understanding models for content, speaker, emotion, and environmental sound recognition; Pretrain audio generation models using Audio Token, Neural Codec, autoregressive, diffusion, or flow matching methods; Model full-duplex interaction behaviors including turn-taking, interruption, and streaming generation; Build and curate large-scale audio pretraining datasets; Optimize model scaling, training stability, and post-training evaluation for product deployment