LTX-2: The First Open-Weights Model That Generates Video and Audio in One Pass
Every text-to-video model released before LTX-2 generates silent video. The audio you see in demos is added afterward by a separate model or manually. LTX-2 (Lightricks, arXiv:2601.03233, January 6, 2026) generates synchronized video and audio jointly in a single diffusion pass. The architecture required to make that work, an asymmetric dual-stream transformer with 14B video parameters and 5B audio parameters, is the story.