Technical articles, tutorials, and insights
Real-time interactive streaming digital human engine widely deployed in production. Supports Wav2Lip, MuseTalk, ER-NeRF, and Ultralight-Digital-Human rendering models. Features: voice cloning, interrupt-and-resume dialog, full-body video compositing, WebRTC/RTMP/virtual camera output, and multi-session concurrency. Core pipeline: text/voice input → LLM response → TTS synthesis → lip-sync inference → audio/video stream. Plugin architecture for TTS/Avatar/Output modules. Python, Apache-2.0, 9k Stars.