CareerPlanSign in

微信-语音全双工对话大模型预训练算法工程师

Beijing, China💼 Full-time🗓 2026-09-28

Core

Design and pretrain large-scale full-duplex conversational voice models enabling real-time interruption, natural turn-taking, and continuous dialogue.

Role type

Senior IC machine-learning engineer (full-duplex voice LLM)

Builds

Production-ready full-duplex voice dialogue models and audio understanding/generation systems

Domain

Consumer technology / Speech AI / Large Language Models

Deliverable

production ML models

Required skills

Full-duplex voice dialogue model pretraining, Audio LLM development, Audio understanding model pretraining, Audio generation model pretraining, Turn-taking modeling, End-of-turn detection, User interruption handling, Overlapping speech processing, Backchannel modeling, Streaming generation, Audio Encoder architecture, Conformer architecture, Transformer architecture, Audio Tokenization, Neural Codec, Autoregressive modeling, Diffusion modeling, Flow Matching, PyTorch, Large-scale distributed training, DeepSpeed, Megatron-LM, FSDP

Preferred skills

Experience with Speech-to-Speech models, Omni Model research, Experimental design, Cross-functional collaboration

Technologies

PyTorch, DeepSpeed, Megatron-LM, FSDP, Conformer, Transformer, Neural Codec, Diffusion, Flow Matching

Responsibilities

Design and pretrain full-duplex conversational voice model architectures; Pretrain audio understanding models for content, speaker, emotion, and environmental sound recognition; Pretrain audio generation models using Audio Token, Neural Codec, autoregressive, diffusion, or flow matching methods; Model full-duplex interaction behaviors including turn-taking, interruption, and streaming generation; Build and curate large-scale audio pretraining datasets; Optimize model scaling, training stability, and post-training evaluation for product deployment

Sourced via tencent · Listed on CareerPlan, which tracks 845,000+ jobs from 20+ sources.