NeurIPS 2025 Oral Papers

NeurIPSOral2025

All 77 papers accepted as Oral at NeurIPS 2025 — the top slice of the accepted programme. Every title links to its own page with authors, affiliation and sources.

All 77 papers

  1. Generalized Linear Mode Connectivity for TransformersAlexander Theus, Alessandro Cabodi, Sotiris Anagnostidis et al. · ETHZ - ETH Zurich
  2. Deep Compositional Phase Diffusion for Long Motion Sequence GenerationHo Yin Au, Jie Chen, Junkun Jiang et al. · Hong Kong Baptist University
  3. GnnXemplar: Exemplars to Explanations - Natural Language Rules for Global GNN InterpretabilityBurouj Armgaan, Eshan Jain, Harsh Pandey et al. · Indian Institute of Technology Delhi
  4. RAG4GFM: Bridging Knowledge Gaps in Graph Foundation Models through Graph Retrieval Augmented GenerationXingliang Wang, Zemin Liu, Junxiao Han et al. · Zhejiang University
  5. Agnostic Active Learning Is Always Better Than Passive LearningSteve Hanneke · Purdue University
  6. Learning Linear Attention in Polynomial TimeMorris Yau, Ekin Akyürek, Jiayuan Mao et al. · Massachusetts Institute of Technology
  7. Optimal Mistake Bounds for Transductive Online LearningZachary Chase, Steve Hanneke, Shay Moran et al. · University of California, San Diego
  8. State Entropy Regularization for Robust Reinforcement LearningYonatan Ashlag, Uri Koren, Mirco Mutti et al. · Technion - Israel Institute of Technology, Technion
  9. On the Closed-Form of Flow Matching: Generalization Does Not Arise from Target StochasticityQuentin Bertrand, Anne Gagneux, Mathurin Massias et al. · INRIA
  10. Why Diffusion Models Don’t Memorize: The Role of Implicit Dynamical Regularization in TrainingTony Bonnaire, Raphaël Urfin, Giulio Biroli et al. · Université Paris-Saclay
  11. Adjoint Schrödinger Bridge SamplerGuan-Horng Liu, Jaemoo Choi, Yongxin Chen et al. · FAIR, Meta AI
  12. Breaking the Performance Ceiling in Reinforcement Learning requires Inference StrategiesFelix Chalumeau, Daniel Rajaonarivonivelomanantsoa, Ruan John de Kock et al. · InstaDeep
  13. High-Dimensional Calibration from Swap RegretMaxwell Fishelson, Noah Golowich, Mehryar Mohri et al. · Massachusetts Institute of Technology
  14. In Search of Adam’s Secret SauceAntonio Orvieto, Robert M. Gower · ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center, Tübingen, Germany
  15. An Optimized Franz-Parisi Criterion and its Equivalence with SQ Lower BoundsSiyu Chen, Theodor Misiakiewicz, Ilias Zadik et al. · Yale University
  16. MaxSup: Overcoming Representation Collapse in Label SmoothingYuxuan Zhou, Heng Li, Zhi-Qi Cheng et al. · Baidu
  17. Memory Mosaics at scaleJianyu Zhang, Leon Bottou · New York University
  18. The emergence of sparse attention: impact of data distribution and benefits of repetitionNicolas Zucchet, Francesco D'Angelo, Andrew Kyle Lampinen et al. · ETHZ - ETH Zurich
  19. ControlFusion: A Controllable Image Fusion Network with Language-Vision Degradation PromptsLinfeng Tang, Yeda Wang, Zhanchuan Cai et al. · Wuhan University
  20. Identifiability of Deep Polynomial Neural NetworksKonstantin Usevich, Ricardo Augusto Borsoi, Clara Dérand et al. · CNRS
  21. Understanding and Mitigating Numerical Sources of Nondeterminism in LLM InferenceJiayi Yuan, Hao Li, Xinheng Ding et al. · Rice University
  22. PRIMT: Preference-based Reinforcement Learning with Multimodal Feedback and Trajectory Synthesis from Foundation ModelsRuiqi Wang, Dezhong Zhao, Ziqin Yuan et al. · Purdue University
  23. A is for Absorption: Studying Feature Splitting and Absorption in Sparse AutoencodersDavid Chanin, James Wilken-Smith, Tomáš Dulka et al. · MATS
  24. EvoLM: In Search of Lost Training Dynamics for Language Model ReasoningZhenting Qi, Fan Nie, Alexandre Alahi et al. · Harvard University
  25. Analog In-memory Training on General Non-ideal Resistive Elements: The Impact of Response FunctionsZhaoxian Wu, Quan Xiao, Tayfun Gokmen et al. · Cornell University
  26. Discovering Opinion Intervals from Conflicts in Signed GraphsPeter Blohm, Florian Chen, Aristides Gionis et al. · Technische Universität Wien
  27. A Clean Slate for Offline Reinforcement LearningMatthew Thomas Jackson, Uljad Berdica, Jarek Luca Liesen et al. · Google DeepMind
  28. Spectral Perturbation Bounds for Low-Rank Approximation with Applications to PrivacyPhuc Tran, Van Vu, Nisheeth K. Vishnoi · VinUniversity
  29. Improved Regret Bounds for Gaussian Process Upper Confidence Bound in Bayesian OptimizationShogo Iwazaki · MI-6 Ltd.
  30. Auto-Compressing NetworksVaggelis Dorovatas, Georgios Paraskevopoulos, Alexandros Potamianos · National Technical University of Athens
  31. MokA: Multimodal Low-Rank Adaptation for MLLMsYake Wei, Yu Miao, Dongzhan Zhou et al. · Renmin University of China
  32. Advancing Expert Specialization for Better MoEHongcan Guo, Haolang Lu, Guoshun Nan et al. · ByteDance Inc.
  33. From Condensation to Rank Collapse: A Two-Stage Analysis of Transformer Training DynamicsZheng-An Chen, Tao Luo · Shanghai Jiaotong University
  34. Large Language Diffusion ModelsShen Nie, Fengqi Zhu, Zebin You et al. · Renmin University of China
  35. Boosting Knowledge Utilization in Multimodal Large Language Models via Adaptive Logits Fusion and Attention ReallocationWenbin An, Jiahao Nie, Feng Tian et al. · Xi'an Jiaotong University
  36. Interactive Cross-modal Learning for Text-3D Scene RetrievalYanglin Feng, Yongxiang Li, Yuan Sun et al. · Sichuan University
  37. Rethinking Joint Maximum Mean Discrepancy for Visual Domain AdaptationWei Wang, Haifeng Xia, Chao Huang et al. · SUN YAT-SEN UNIVERSITY
  38. Pan-LUT: Efficient Pan-sharpening via Learnable Look-Up TablesZhongnan Cai, Yingying Wang, Hui Zheng et al. · Xiamen University
  39. Dynamical Decoupling of Generalization and Overfitting in Large Two-Layer NetworksAndrea Montanari, Pierfrancesco Urbani · Stanford University
  40. 1000 Layer Networks for Self-Supervised RL: Scaling Depth Can Enable New Goal-Reaching CapabilitiesKevin Wang, Ishaan Javali, Michał Bortkiewicz et al. · Princeton University
  41. Depth-Bounds for Neural Networks via the Braid ArrangementMoritz Leo Grillo, Christoph Hertrich, Georg Loho · Max-Planck Institute
  42. Tighter CMI-Based Generalization Bounds via Stochastic Projection and QuantizationMilad Sefidgaran, Kimia Nadjahi, Abdellatif Zaidi · Huawei Paris Research Center
  43. A Snapshot of Influence: A Local Data Attribution Framework for Online Reinforcement LearningYuzheng Hu, Fan Wu, Haotian Ye et al. · University of Illinois at Urbana-Champaign
  44. High-dimensional neuronal activity from low-dimensional latent dynamics: a solvable modelValentin Schmutz, Ali Haydaroğlu, Shuqi Wang et al. · University College London, University of London
  45. Adaptive Surrogate Gradients for Sequential Reinforcement Learning in Spiking Neural NetworksKorneel Van den Berghe, Stein Stroobants, Vijay Janapa Reddi et al. · Delft University of Technology
  46. Class-wise Balancing Data Replay for Federated Class-Incremental LearningZhuang Qi, Ying-Peng Tang, Lei Meng et al. · Shandong University
  47. Task-Optimized Convolutional Recurrent Networks Align with Tactile Processing in the Rodent BrainTrinity Chung, Yuchen Shen, Nathan Kong et al.
  48. ElasticMM: Efficient Multimodal LLMs Serving with Elastic Multimodal ParallelismZedong Liu, Shenggan Cheng, Guangming Tan et al. · University of Electronic Science and Technology of China
  49. Dynamical Low-Rank Compression of Neural Networks with Robustness under Adversarial AttacksSteffen Schotthöfer, H. Lexie Yang, Stefan Schnake · Oak Ridge National Laboratory
  50. QoQ-Med: Building Multimodal Clinical Foundation Models with Domain-Aware GRPO TrainingWei Dai, Peilin Chen, Chanakya Ekbote et al. · Massachusetts Institute of Technology
  51. Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-FreeZihan Qiu, Zekun Wang, Bo Zheng et al. · Alibaba Group
  52. Learning long range dependencies through time reversal symmetry breakingGuillaume Pourcel, Maxence Ernoult · INRIA
  53. FuXi-Ocean: A Global Ocean Forecasting System with Sub-Daily ResolutionQiusheng Huang, Yuan Niu, Xiaohui Zhong et al. · Fudan University
  54. Superposition Yields Robust Neural ScalingYizhou Liu, Ziming Liu, Jeff Gore · Massachusetts Institute of Technology
  55. ImageNet-trained CNNs are not biased towards texture: Revisiting feature reliance through controlled suppressionTom Burgert, Oliver Stoll, Paolo Rota et al. · Technische Universität Berlin
  56. On Linear Mode Connectivity of Mixture-of-Experts ArchitecturesViet-Hoang Tran, Van-Hoan Trinh, Khanh Vinh Bui et al. · National University of Singapore
  57. OpenHOI: Open-World Hand-Object Interaction Synthesis with Multimodal Large Language ModelZhenhao Zhang, Ye Shi, Lingxiao Yang et al.
  58. Representation Entanglement for Generation: Training Diffusion Transformers Is Much Easier Than You ThinkGe Wu, Shen Zhang, Ruijing Shi et al. · Nankai University
  59. Dynam3D: Dynamic Layered 3D Tokens Empower VLM for Vision-and-Language NavigationZihan Wang, Seungjun Lee, Gim Hee Lee · National University of Singapore
  60. Learning (Approximately) Equivariant Networks via Constrained OptimizationAndrei Manolache, Luiz F. O. Chamon, Mathias Niepert · Universität Stuttgart
  61. SAGE: A Unified Framework for Generalizable Object State Recognition with State-Action Graph EmbeddingYuan Zang, Zitian Tang, Junho Cho et al. · Brown University
  62. Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?Yang Yue, Zhiqi Chen, Rui Lu et al.
  63. Learning to Learn with Contrastive Meta-ObjectiveShiguang Wu, Yaqing Wang, Yatao Bian et al. · Tsinghua University, Tsinghua University
  64. KVzip: Query-Agnostic KV Cache Compression with Context ReconstructionJang-Hyun Kim, Jinuk Kim, Sangwoo Kwon et al. · Apple
  65. HyperET: Efficient Training in Hyperbolic Space for Multi-modal Large Language ModelsZelin Peng, Zhengqin Xu, Qingyang Liu et al. · Shanghai Jiaotong University
  66. SAVVY: Spatial Awareness via Audio-Visual LLMs through Seeing and HearingMingfei Chen, Zijun Cui, Xiulong Liu et al. · University of Washington
  67. A multiscale analysis of mean-field transformers in the moderate interaction regimeGiuseppe Bruno, Federico Pasqualotto, Andrea Agazzi · Universität Bern
  68. Exploring Diffusion Transformer Designs via GraftingKeshigeyan Chandrasegaran, Michael Poli, Daniel Y Fu et al. · Stanford University
  69. Generalized Gradient Norm Clipping & Non-Euclidean $(L_0,L_1)$-SmoothnessThomas Pethick, Wanyun Xie, Mete Erdogan et al. · Swiss Federal Institute of Technology Lausanne
  70. Rethinking Multimodal Learning from the Perspective of Mitigating Classification Ability DisproportionQing-Yuan Jiang, Longfei Huang, Yang Yang · Nanjing University of Science and Technology
  71. TransferTraj: A Vehicle Trajectory Learning Model for Region and Task TransferabilityTonglong Wei, Yan Lin, Zeyu Zhou et al. · Beijing Jiaotong University
  72. PhySense: Sensor Placement Optimization for Accurate Physics SensingYuezhou Ma, Haixu Wu, Hang Zhou et al. · Tsinghua University, Tsinghua University
  73. InfinityStar: Unified Spacetime AutoRegressive Modeling for Visual GenerationJinlai Liu, Jian Han, Bin Yan et al. · ByteDance Inc.
  74. Does Stochastic Gradient really succeed for bandits?Dorian Baudry, Emmeran Johnson, Simon Vary et al. · INRIA
  75. Perception Encoder: The best visual embeddings are not at the output of the networkDaniel Bolya, Po-Yao Huang, Peize Sun et al. · Meta
  76. PlayerOne: Egocentric World SimulatorYuanpeng Tu, Hao Luo, Xi Chen et al. · The University of Hong Kong
  77. Mean Flows for One-step Generative ModelingZhengyang Geng, Mingyang Deng, Xingjian Bai et al. · Carnegie Mellon University

← Browse the whole archive