PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding

NeurIPSSpotlight2025

Authors
Jang Hyun Cho, Andrea Madotto, Effrosyni Mavroudi, Triantafyllos Afouras, Tushar Nagarajan, Muhammad Maaz, Yale Song, Tengyu Ma, Shuming Hu, Suyog Jain, Miguel Martin, Huiyu Wang, Hanoona Abdul Rasheed, Peize Sun, Po-Yao Huang, Daniel Bolya, Nikhila Ravi, Shashank Jain, Tammy Stark, Seungwhan Moon, Babak Damavandi, Vivian Lee, Andrew Westbury, Salman Khan, Philipp Kraehenbuehl, Piotr Dollar, Lorenzo Torresani, Kristen Grauman, Christoph Feichtenhofer
Venue
NeurIPS 2025
Track
Spotlight

TL;DR

Vision-language models are integral to computer vision research, yet many high-performing models remain closed-source, obscuring their data, design and training recipe…

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

computer vision vision-language language model

← All NeurIPS 2025 Spotlight papers · Browse the whole archive