Cheng, Ruoxi
- Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs
2024/04/15 by Cheng, Ruoxi, Ma, Haoxuan, Cao, Shuirong +6 · 8 citations
#Artificial Intelligence (cs.AI) #FOS: Computer and information sciences
- Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
2025/03/23 by Cheng, Ruoxi, Ma, Haoxuan, Wang, Weixin +7 · 9 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
- PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
2024/12/08 by Ruoxi Cheng, Yizhong Ding, Cheng, Ruoxi +12 · 5 citations
Computer Science · #Network Security and Intrusion Detection
- Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
2024/10/24 by Ruoxi Cheng, Yizhong Ding, Cheng, Ruoxi +7 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech and dialogue systems #electronic engineering #information engineering
- AGR: Age Group fairness Reward for Bias Mitigation in LLMs
2024/09/06 by Shuirong Cao, Ruoxi Cheng, Cao, Shuirong +3 · 3 citations
Business, Management and Accounting · Economics, Econometrics and Finance · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Dispute Resolution and Class Actions #FOS: Computer and information sciences #Law, Economics, and Judicial Systems #Machine Learning (cs.LG)
- TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
2024/05/23 by Songze Li, Li, Songze, Ruoxi Cheng +3 · 2 citations
Computer Science · #Topic Modeling #Natural Language Processing Techniques
- Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
2025/09/02 by Duan, Ranjie, Liu, Jiexi, Jia, Xiaojun +27 · 8 citations
#Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Symbolic Computation (cs.SC)
- KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
2024/06/16 by Aihua Pei, Zehua Yang, Pei, Aihua +9 · 1 citation
Computer Science · #Natural Language Processing Techniques #Topic Modeling
- SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
2024/12/01 by Aihua Pei, Zehua Yang, Pei, Aihua +7 · 1 citation
Computer Science · #Adversarial Robustness in Machine Learning
- L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training
2025/07/11 by Li, Li, Peng, Yingzhe, Yang, Xu +4 · 2 citations
#Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences