RESEARCHInvestigateNEXT 12 MONTHS
When Skills Meet Safety: Benchmarking and Characterizing the Adaptive Jailbreak Robustness of Skill-Merged LLMs
arXiv cs.LG — Machine Learning
Factual evidence
What the source reports
Research shows model merging techniques degrade LLM safety alignment significantly more under adaptive jailbreaks than static tests indicate.
Open source