Weng, Fenghua
- MMJ-Bench: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models
2024/08/16 by Weng, Fenghua, Xu, Yue, Fu, Chengyan +1 · 5 citations
#Cryptography and Security (cs.CR) #FOS: Computer and information sciences
- Adversary-Aware DPO: Enhancing Safety Alignment in Vision Language Models via Adversarial Training
2025/02/17 by Fenghua Weng, Weng, Fenghua, Jian Lou +7 · 5 citations
Computer Science · #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- DELMAN: Dynamic Defense Against Large Language Model Jailbreaking with Model Editing
2025/02/17 by Yi Wang, Wang, Yi, Fenghua Weng +9 · 4 citations
Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #Digital and Cyber Forensics #FOS: Computer and information sciences #Privacy-Preserving Technologies in Data