J.H. Wang
- Eraser: Jailbreaking Defense in Large Language Models via Unlearning Harmful Knowledge
2024/04/08 by Weikai Lu, Ziqian Zeng, Lu, Weikai +11 · 7 citations
Computer Science · #Adversarial Robustness in Machine Learning #Hate Speech and Cyberbullying Detection
- PrivacyRestore: Privacy-Preserving Inference in Large Language Models via Privacy Removal and Restoration
2024/06/03 by Ziqian Zeng, Zeng, Ziqian, J.H. Wang +9 · 3 citations
Computer Science · #Privacy-Preserving Technologies in Data