Adaptive Defense against Harmful Fine-Tuning for Large Language Models via Bayesian Data Scheduler
NeurIPSSpotlight2025
TL;DR
Harmful fine-tuning poses critical safety risks to fine-tuning-as-a-service for large language models…
Opening excerpt from the authors’ abstract. source
Read the paper
Topics
large language model language model fine-tuning bayesian safety
← All NeurIPS 2025 Spotlight papers · Browse the whole archive