vix.ing · top · new · best · stats · spec

Cheng, Ruoxi

  1. Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs
    2024/04/15 by Cheng, Ruoxi, Ma, Haoxuan, Cao, Shuirong +6 · 8 citations
    #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences
  2. Inverse Reinforcement Learning with Dynamic Reward Scaling for LLM Alignment
    2025/03/23 by Cheng, Ruoxi, Ma, Haoxuan, Wang, Weixin +7 · 9 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG)
  3. PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization
    2024/12/08 by Ruoxi Cheng, Yizhong Ding, Cheng, Ruoxi +12 · 5 citations
    Computer Science · #Network Security and Intrusion Detection
  4. Gibberish is All You Need for Membership Inference Detection in Contrastive Language-Audio Pretraining
    2024/10/24 by Ruoxi Cheng, Yizhong Ding, Cheng, Ruoxi +7 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Audio and Speech Processing (eess.AS) #FOS: Computer and information sciences #FOS: Electrical engineering #Natural Language Processing Techniques #Sound (cs.SD) #Speech and dialogue systems #electronic engineering #information engineering
  5. AGR: Age Group fairness Reward for Bias Mitigation in LLMs
    2024/09/06 by Shuirong Cao, Ruoxi Cheng, Cao, Shuirong +3 · 3 citations
    Business, Management and Accounting · Economics, Econometrics and Finance · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Dispute Resolution and Class Actions #FOS: Computer and information sciences #Law, Economics, and Judicial Systems #Machine Learning (cs.LG)
  6. TUNI: A Textual Unimodal Detector for Identity Inference in CLIP Models
    2024/05/23 by Songze Li, Li, Songze, Ruoxi Cheng +3 · 2 citations
    Computer Science · #Topic Modeling #Natural Language Processing Techniques
  7. Oyster-I: Beyond Refusal -- Constructive Safety Alignment for Responsible Language Models
    2025/09/02 by Duan, Ranjie, Liu, Jiexi, Jia, Xiaojun +27 · 8 citations
    #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computers and Society (cs.CY) #FOS: Computer and information sciences #Human-Computer Interaction (cs.HC) #Symbolic Computation (cs.SC)
  8. KGPA: Robustness Evaluation for Large Language Models via Cross-Domain Knowledge Graphs
    2024/06/16 by Aihua Pei, Zehua Yang, Pei, Aihua +9 · 1 citation
    Computer Science · #Natural Language Processing Techniques #Topic Modeling
  9. SelfPrompt: Autonomously Evaluating LLM Robustness via Domain-Constrained Knowledge Guidelines and Refined Adversarial Prompts
    2024/12/01 by Aihua Pei, Zehua Yang, Pei, Aihua +7 · 1 citation
    Computer Science · #Adversarial Robustness in Machine Learning
  10. L-CLIPScore: a Lightweight Embedding-based Captioning Metric for Evaluating and Training
    2025/07/11 by Li, Li, Peng, Yingzhe, Yang, Xu +4 · 2 citations
    #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences