Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler

NeurIPSSpotlight2025

Authors
Zixuan Hu, Li Shen, Zhenyi Wang, Yongxian Wei, Dacheng Tao
Venue
NeurIPS 2025
Track
Spotlight

TL;DR

Harmful fine-tuning poses critical safety risks to fine-tuning-as-a-service for large language models…

Opening excerpt from the authors’ abstract. source

Read the paper

Topics

large language model language model fine-tuning bayesian safety

← All NeurIPS 2025 Spotlight papers · Browse the whole archive