SANA-Video: Efficient Video Generation with Block Linear Diffusion Transformer

ICLROral2026

Authors
Junsong Chen, Yuyang Zhao, Jincheng YU, Ruihang Chu, Junyu Chen, Shuai Yang, Xianbang Wang, Yicheng Pan, Daquan Zhou, Huan Ling, Haozhe Liu, Hongwei Yi, Hao Zhang, Muyang Li, Yukang Chen, Han Cai, Sanja Fidler, Ping Luo, Song Han, Enze Xie
Affiliation
University of Hong Kong
Venue
ICLR 2026
Track
Oral

TL;DR

We introduce SANA-Video, a small diffusion model that can efficiently generate videos up to 720×1280 resolution and minute-length duration. SANA-Video synthesizes high-resolution, high-quality and long videos with strong text-video alignment at a remarkably fast speed, deployable on RTX 5090 GPU.

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

transformer alignment diffusion efficient video

← All ICLR 2026 Oral papers · Browse the whole archive