Lihong Li
- Neural Logic Machines
2019/04/26 by Honghua Dong, Dong, Honghua, Jiayuan Mao +9 · 2 voices · 21 citations
Computer Science · Mathematics · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Logic, Reasoning, and Knowledge #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Natural Language Processing Techniques #Topic Modeling #cs.AI #cs.LG #stat.ML
- Doubly Robust Policy Evaluation and Learning
2011/03/23 by Miroslav Dudı́k, Dudik, Miroslav, John Langford +3 · 61 citations
Decision Sciences · Health Professions · Mathematics · #Advanced Bandit Algorithms Research #Advanced Causal Inference Techniques #Applications (stat.AP) #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Healthcare Operations and Scheduling Optimization #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Robotics (cs.RO)
- Taming the Monster: A Fast and Simple Algorithm for Contextual Bandits
2014/02/04 by Alekh Agarwal, Agarwal, Alekh, Daniel Hsu +9 · 76 citations
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Machine Learning and Algorithms #Data Stream Mining Techniques
- Contextual Bandit Algorithms with Supervised Learning Guarantees
2010/02/22 by Alina Beygelzimer, Beygelzimer, Alina, John Langford +7 · 25 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #I.2.6 #Machine Learning (cs.LG) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Neural Approaches to Conversational AI
2018/09/21 by Jianfeng Gao, Michel Galley, Gao, Jianfeng +3 · 1 voice · 8 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #cs.CL
- Breaking the Curse of Horizon: Infinite-Horizon Off-Policy Estimation
2018/10/29 by Qiang Liu, Liu, Qiang, Lihong Li +5 · 36 citations
Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #Age of Information Optimization #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Smart Grid Energy Management #Systems and Control (eess.SY) #electronic engineering #information engineering
- Doubly Robust Policy Evaluation and Optimization
2014/11/01 by Miroslav Dudík, Dumitru Erhan, John Langford +1 · 16 citations
- A User Simulator for Task-Completion Dialogues
2016/12/17 by Xiujun Li, Li, Xiujun, Zachary C. Lipton +9 · 17 citations
Computer Science · #AI in Service Interactions #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Speech and dialogue systems #Topic Modeling
- SBEED: Convergent Reinforcement Learning with Nonlinear Function Approximation
2017/12/29 by Bo Dai, Albert Shaw, Dai, Bo +13 · 19 citations
Computer Science · #Adaptive Dynamic Programming Control #Distributed Control Multi-Agent Systems #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics
- Neural Thompson Sampling
2020/10/02 by Weitong Zhang, Zhang, Weitong, Dongruo Zhou +5 · 11 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Adversarial Attacks on Stochastic Bandits
2018/10/29 by Kwang-Sung Jun, Jun, Kwang-Sung, Lihong Li +5 · 17 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #Cryptography and Security (cs.CR) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms
- DualDICE: Behavior-Agnostic Estimation of Discounted Stationary Distribution Corrections
2019/06/10 by Ofir Nachum, Nachum, Ofir, Yinlam Chow +5 · 11 citations
Computer Science · Engineering · Decision Sciences · #Reinforcement Learning in Robotics #Smart Grid Energy Management #Advanced Bandit Algorithms Research
- GenDICE: Generalized Offline Estimation of Stationary Values
2020/02/21 by Ruiyi Zhang, Bo Dai, Zhang, Ruiyi +5 · 20 citations
Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Advanced Bandit Algorithms Research #Machine Learning and Algorithms
- Deep Reinforcement Learning with a Natural Language Action Space
2015/11/14 by Ji He, He, Ji, Jianshu Chen +11 · 11 citations
Computer Science · #Topic Modeling #Artificial Intelligence in Games #Natural Language Processing Techniques
- Randomized Exploration in Generalized Linear Bandits
2019/06/21 by Branislav Kveton, Manzil Zaheer, Kveton, Branislav +9 · 7 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Stochastic Gradient Optimization Techniques
- WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning
2025/05/22 by Zhepei Wei, Wei, Zhepei, Wenlin Yao +21 · 43 citations
Computer Science · #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Natural Language Processing Techniques #Topic Modeling
- Neuro-Symbolic Program Synthesis
2016/11/06 by Emilio Parisotto, Parisotto, Emilio, Abdelrahman Mohamed +9 · 8 citations
Computer Science · Engineering · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Oil and Gas Production Techniques #Programming Languages (cs.PL) #Software Engineering Research #Software Testing and Debugging Techniques
- Sample Complexity of Multi-task Reinforcement Learning
2013/09/26 by Emma Brunskill, Lihong Li, Brunskill, Emma +1 · 5 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Advanced Multi-Objective Optimization Algorithms #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
- An efficient algorithm for contextual bandits with knapsacks, and an extension to concave objectives
2015/06/10 by Shipra Agrawal, Agrawal, Shipra, Nikhil R. Devanur +3 · 4 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Optimization and Search Problems #Reinforcement Learning in Robotics
- A Kernel Loss for Solving the Bellman Equation
2019/05/25 by Yihao Feng, Lihong Li, Feng, Yihao +3 · 7 citations
Computer Science · Physics and Astronomy · #Adaptive Dynamic Programming Control #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Model Reduction and Neural Networks #Reinforcement Learning in Robotics
- BBQ-Networks: Efficient Exploration in Deep Reinforcement Learning for Task-Oriented Dialogue Systems
2016/08/17 by Zachary C. Lipton, Xiujun Li, Lipton, Zachary C. +9 · 4 citations
Computer Science · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Neural and Evolutionary Computing (cs.NE) #Reinforcement Learning in Robotics #Speech and dialogue systems #Topic Modeling
- Composite Task-Completion Dialogue Policy Learning via Hierarchical Deep Reinforcement Learning
2017/04/10 by Baolin Peng, Xiujun Li, Peng, Baolin +11 · 3 citations
Computer Science · #Speech and dialogue systems #Topic Modeling #Multi-Agent Systems and Negotiation
- Off-policy Evaluation in Infinite-Horizon Reinforcement Learning with\n Latent Confounders
2020/07/27 by Andrew Bennett, Bennett, Andrew, Nathan Kallus +5 · 4 citations
Computer Science · Environmental Science · Economics, Econometrics and Finance · #Reinforcement Learning in Robotics #Environmental Impact and Sustainability #Health Systems, Economic Evaluations, Quality of Life
- Neural Contextual Bandits with UCB-based Exploration
2019/11/11 by Dongruo Zhou, Lihong Li, Zhou, Dongruo +3 · 3 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Adversarial Robustness in Machine Learning #Age of Information Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML)
- On the Optimality of Batch Policy Optimization Algorithms
2021/04/06 by Chenjun Xiao, Yifan Wu, Xiao, Chenjun +13 · 2 citations
Computer Science · Engineering · #Advanced Manufacturing and Logistics Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Optimization and Search Problems #Scheduling and Optimization Algorithms
- On the Prior Sensitivity of Thompson Sampling
2015/06/10 by Che-Yu Liu, Lihong Li, Liu, Che-Yu +1 · 2 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Age of Information Optimization #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
- Off-Policy Evaluation via the Regularized Lagrangian
2020/07/07 by Mengjiao Yang, Yang, Mengjiao, Ofir Nachum +7 · 3 citations
Computer Science · Decision Sciences · Mathematics · #Advanced Causal Inference Techniques #FOS: Computer and information sciences #FOS: Mathematics #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Optimization and Control (math.OC) #Probabilistic and Robust Engineering Design #Software Reliability and Analysis Research
- Efficient Reinforcement Learning in Factored MDPs with Application to Constrained RL
2020/08/30 by Xiaoyu Chen, Chen, Xiaoyu, Jiachen Hu +5 · 1 citation
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- A Map of Bandits for E-commerce
2021/07/01 by Yi Liu, Lihong Li, Liu, Yi +1 · 1 citation
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Auction Theory and Applications #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Algorithms
- Turn-PPO: Turn-Level Advantage Estimation with PPO for Improved Multi-Turn RL in Agentic LLMs
2025/12/18 by Junbo Li, Li, Junbo, Peng Zhou +9 · 2 citations
Computer Science · #Artificial Intelligence in Games #FOS: Computer and information sciences #Machine Learning (cs.LG) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics