Blackbox Model Provenance via Palimpsestic Membership Inference

NeurIPSSpotlight2025

Authors
Rohith Kuditipudi, Jing Huang, Sally Zhu, Diyi Yang, Christopher Potts, Percy Liang
Venue
NeurIPS 2025
Track
Spotlight

TL;DR

Suppose Alice trains an open-weight language model and Bob uses a blackbox derivative of Alice’s model to produce text…

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

language model

← All NeurIPS 2025 Spotlight papers · Browse the whole archive