vix.ing · top · new · best · stats · spec

Tengyang Xie

  1. Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
    2024/04/04 by Corby Rosset, Rosset, Corby, Ching-An Cheng +9 · 4 voices · 13 citations
    #cs.LG #cs.AI #cs.CL
  2. Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
    2024/06/18 by Haoxiang Wang, Wang, Haoxiang, Wei Xiong +7 · 70 citations
    Computer Science · Decision Sciences · #Bayesian Modeling and Causal Inference #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multi-Criteria Decision Making
  3. Q* Approximation Schemes for Batch Reinforcement Learning: A Theoretical Comparison
    2020/03/09 by Tengyang Xie, Xie, Tengyang, Nan Jiang +1 · 1 voice · 4 citations
    Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Advanced Multi-Objective Optimization Algorithms #Reinforcement Learning in Robotics #cs.AI #cs.LG #stat.ML
  4. Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
    2024/04/22 by Fahim Tajwar, Tajwar, Fahim, Anikait Singh +15 · 24 citations
    Decision Sciences · Economics, Econometrics and Finance · #Efficiency Analysis Using DEA #Healthcare Policy and Management #Auction Theory and Applications
  5. Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
    2024/05/31 by Tengyang Xie, Xie, Tengyang, Dylan J. Foster +10 · 1 voice · 19 citations
    Computer Science · Mathematics · #Advanced Data Compression Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Management and Algorithms #FOS: Computer and information sciences #Face and Expression Recognition #Machine Learning (cs.LG) #Machine Learning (stat.ML) #cs.AI #cs.CL #cs.LG #stat.ML
  6. Bellman-consistent Pessimism for Offline Reinforcement Learning
    2021/06/13 by Tengyang Xie, Ching-An Cheng, Xie, Tengyang +7 · 13 citations
    Computer Science · #Reinforcement Learning in Robotics #Machine Learning and Data Classification #Evolutionary Algorithms and Applications
  7. Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning
    2021/06/09 by Tengyang Xie, Nan Jiang, Xie, Tengyang +7 · 10 citations
    Computer Science · #Reinforcement Learning in Robotics #Adversarial Robustness in Machine Learning #Machine Learning and Algorithms
  8. Adversarially Trained Actor Critic for Offline Reinforcement Learning
    2022/02/05 by Ching-An Cheng, Tengyang Xie, Cheng, Ching-An +5 · 7 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Reinforcement Learning in Robotics #Explainable Artificial Intelligence (XAI)
  9. Batch Value-function Approximation with Only Realizability
    2020/08/11 by Tengyang Xie, Nan Jiang, Xie, Tengyang +1 · 14 citations
    Computer Science · Engineering · #Reinforcement Learning in Robotics #Machine Learning and Algorithms #Scheduling and Optimization Algorithms
  10. Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
    2024/07/18 by Audrey Huang, Wenhao Zhan, Huang, Audrey +11 · 1 voice · 9 citations
    Computer Science · Engineering · #Advanced Multi-Objective Optimization Algorithms #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Neural Networks and Applications #Topology Optimization in Engineering #cs.AI #cs.CL #cs.LG
  11. CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
    2024/02/20 by Jianrui Zhang, Mu Cai, Zhang, Jianrui +5 · 6 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Semantic Web and Ontologies #Topic Modeling
  12. Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency
    2021/02/05 by Masatoshi Uehara, Uehara, Masatoshi, Masaaki Imaizumi +9 · 6 citations
    Computer Science · #FOS: Computer and information sciences #FOS: Mathematics #Formal Methods in Verification #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Software Reliability and Analysis Research #Statistics Theory (math.ST)
  13. A Variant of the Wang-Foster-Kakade Lower Bound for the Discounted Setting
    2020/11/02 by Philip Amortila, Nan Jiang, Amortila, Philip +3 · 5 citations
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Advanced Bandit Algorithms Research #Adversarial Robustness in Machine Learning
  14. Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
    2024/06/06 by Xiang Ji, Ji, Xiang, Sanjeev Kulkarni +5 · 3 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
  15. Provably Efficient Q-Learning with Low Switching Cost
    2019/05/30 by Yu Bai, Tengyang Xie, Bai, Yu +5 · 1 citation
    Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #Blind Source Separation Techniques #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Sparse and Compressive Sensing Techniques
  16. Harnessing Density Ratios for Online Reinforcement Learning
    2024/01/18 by Philip Amortila, Amortila, Philip, Dylan J. Foster +7 · 1 citation
    Computer Science · #Reinforcement Learning in Robotics #Machine Learning and Data Classification #Software Engineering Research
  17. Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
    2025/10/05 by Nan Jiang, Tengyang Xie, Jiang, Nan +1 · 1 voice · 2 citations
    Computer Science · #Adaptive Dynamic Programming Control #Evolutionary Algorithms and Applications #Reinforcement Learning in Robotics #cs.AI #cs.LG #stat.ML