Tengyang Xie
- Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences
2024/04/04 by Corby Rosset, Rosset, Corby, Ching-An Cheng +9 · 4 voices · 13 citations
#cs.LG #cs.AI #cs.CL
- Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts
2024/06/18 by Haoxiang Wang, Wang, Haoxiang, Wei Xiong +7 · 70 citations
Computer Science · Decision Sciences · #Bayesian Modeling and Causal Inference #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multi-Criteria Decision Making
- Q* Approximation Schemes for Batch Reinforcement Learning: A Theoretical Comparison
2020/03/09 by Tengyang Xie, Xie, Tengyang, Nan Jiang +1 · 1 voice · 4 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Advanced Multi-Objective Optimization Algorithms #Reinforcement Learning in Robotics #cs.AI #cs.LG #stat.ML
- Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data
2024/04/22 by Fahim Tajwar, Tajwar, Fahim, Anikait Singh +15 · 24 citations
Decision Sciences · Economics, Econometrics and Finance · #Efficiency Analysis Using DEA #Healthcare Policy and Management #Auction Theory and Applications
- Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF
2024/05/31 by Tengyang Xie, Xie, Tengyang, Dylan J. Foster +10 · 1 voice · 19 citations
Computer Science · Mathematics · #Advanced Data Compression Techniques #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Data Management and Algorithms #FOS: Computer and information sciences #Face and Expression Recognition #Machine Learning (cs.LG) #Machine Learning (stat.ML) #cs.AI #cs.CL #cs.LG #stat.ML
- Bellman-consistent Pessimism for Offline Reinforcement Learning
2021/06/13 by Tengyang Xie, Ching-An Cheng, Xie, Tengyang +7 · 13 citations
Computer Science · #Reinforcement Learning in Robotics #Machine Learning and Data Classification #Evolutionary Algorithms and Applications
- Policy Finetuning: Bridging Sample-Efficient Offline and Online Reinforcement Learning
2021/06/09 by Tengyang Xie, Nan Jiang, Xie, Tengyang +7 · 10 citations
Computer Science · #Reinforcement Learning in Robotics #Adversarial Robustness in Machine Learning #Machine Learning and Algorithms
- Adversarially Trained Actor Critic for Offline Reinforcement Learning
2022/02/05 by Ching-An Cheng, Tengyang Xie, Cheng, Ching-An +5 · 7 citations
Computer Science · #Adversarial Robustness in Machine Learning #Reinforcement Learning in Robotics #Explainable Artificial Intelligence (XAI)
- Batch Value-function Approximation with Only Realizability
2020/08/11 by Tengyang Xie, Nan Jiang, Xie, Tengyang +1 · 14 citations
Computer Science · Engineering · #Reinforcement Learning in Robotics #Machine Learning and Algorithms #Scheduling and Optimization Algorithms
- Correcting the Mythos of KL-Regularization: Direct Alignment without Overoptimization via Chi-Squared Preference Optimization
2024/07/18 by Audrey Huang, Wenhao Zhan, Huang, Audrey +11 · 1 voice · 9 citations
Computer Science · Engineering · #Advanced Multi-Objective Optimization Algorithms #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Neural Networks and Applications #Topology Optimization in Engineering #cs.AI #cs.CL #cs.LG
- CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples
2024/02/20 by Jianrui Zhang, Mu Cai, Zhang, Jianrui +5 · 6 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Semantic Web and Ontologies #Topic Modeling
- Finite Sample Analysis of Minimax Offline Reinforcement Learning: Completeness, Fast Rates and First-Order Efficiency
2021/02/05 by Masatoshi Uehara, Uehara, Masatoshi, Masaaki Imaizumi +9 · 6 citations
Computer Science · #FOS: Computer and information sciences #FOS: Mathematics #Formal Methods in Verification #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Software Reliability and Analysis Research #Statistics Theory (math.ST)
- A Variant of the Wang-Foster-Kakade Lower Bound for the Discounted Setting
2020/11/02 by Philip Amortila, Nan Jiang, Amortila, Philip +3 · 5 citations
Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Advanced Bandit Algorithms Research #Adversarial Robustness in Machine Learning
- Self-Play with Adversarial Critic: Provable and Scalable Offline Alignment for Language Models
2024/06/06 by Xiang Ji, Ji, Xiang, Sanjeev Kulkarni +5 · 3 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Topic Modeling
- Provably Efficient Q-Learning with Low Switching Cost
2019/05/30 by Yu Bai, Tengyang Xie, Bai, Yu +5 · 1 citation
Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #Blind Source Separation Techniques #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Sparse and Compressive Sensing Techniques
- Harnessing Density Ratios for Online Reinforcement Learning
2024/01/18 by Philip Amortila, Amortila, Philip, Dylan J. Foster +7 · 1 citation
Computer Science · #Reinforcement Learning in Robotics #Machine Learning and Data Classification #Software Engineering Research
- Offline Reinforcement Learning in Large State Spaces: Algorithms and Guarantees
2025/10/05 by Nan Jiang, Tengyang Xie, Jiang, Nan +1 · 1 voice · 2 citations
Computer Science · #Adaptive Dynamic Programming Control #Evolutionary Algorithms and Applications #Reinforcement Learning in Robotics #cs.AI #cs.LG #stat.ML