Liu, Guozhi
- Targeted Vaccine: Safety Alignment for Large Language Models against Harmful Fine-Tuning via Layer-wise Perturbation
2024/10/13 by Liu, Guozhi, Lin, Weiwei, Huang, Tiansheng +3 · 8 citations
#FOS: Computer and information sciences #Machine Learning (cs.LG)