Latent Speech-Text Transformer
ICLROral2026
TL;DR
We introduce Latent Speech-Text Transformer, which patches long speech token sequences into latent units, improving text–speech transfer while cutting pre-training and inference compute, and significantly outperforming existing speech-text LLMs.
Opening excerpt from the authors’ abstract. source
Read the paper
Topics
pre-training transformer speech llm