KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation

NeurIPSSpotlight2025

Authors
Jiajun Shi, Jian Yang, Jiaheng Liu, Xingyuan Bu, Jiangjie Chen, Junting Zhou, Kaijing Ma, Zhoufutu Wen, Bingli Wang, Yancheng He, Liang Song, Hualei Zhu, Shilong Li, Xingjian Wang, Wei Zhang, Ruibin Yuan, Yifan Yao, Wenjun Yang, Yunli Wang, Siyuan Fang, Siyu Yuan, Qianyu He, Xiangru Tang, Yingshui Tan, Wangchunshu Zhou, Zhaoxiang Zhang, Zhoujun Li, Wenhao Huang, Ge Zhang
Venue
NeurIPS 2025
Track
Spotlight

TL;DR

Recent advancements in large language models (LLMs) underscore the need for more comprehensive evaluation methods to accurately assess their reasoning capabilities…

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

large language model language model evaluation reasoning llm

← All NeurIPS 2025 Spotlight papers · Browse the whole archive