SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and Hearing

NeurIPSOral2025

Authors
Mingfei Chen, Zijun Cui, Xiulong Liu, Jinlin Xiang, Caleb Zheng, Jingyuan Li, Eli Shlizerman
Affiliation
University of Washington
Venue
NeurIPS 2025
Track
Oral

TL;DR

A novel 3D audio-visual QA benchmark and training-free spatial reasoning pipeline for Audio-Visual LLMs…

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

benchmark reasoning audio llm 3d

← All NeurIPS 2025 Oral papers · Browse the whole archive