Csaba Szepesvári
- To Believe or Not to Believe Your LLM
2024/06/04 by Yasin Abbasi Yadkori, Ilja Kuzborskij, Yadkori, Yasin Abbasi +5 · 1 voice · 31 citations
Social Sciences · #Artificial Intelligence in Law #Comparative and International Law Studies #cs.AI #cs.CL #cs.LG
- Bandit Algorithms
2020/07/04 by Tor Lattimore, Csaba Szepesvári · 133 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Machine Learning and Algorithms #Optimization and Search Problems
- Mitigating LLM Hallucinations via Conformal Abstention
2024/04/04 by Yasin Abbasi Yadkori, Yadkori, Yasin Abbasi, Ilja Kuzborskij +21 · 2 voices · 12 citations
Computer Science · Mathematics · Neuroscience · Physics and Astronomy · #Artificial Intelligence (cs.AI) #Benford’s Law and Fraud Detection #Computation and Language (cs.CL) #FOS: Computer and information sciences #Hallucinations in medical conditions #Machine Learning (cs.LG) #Quantum Mechanics and Applications #cs.AI #cs.CL #cs.LG
- On the Global Convergence Rates of Softmax Policy Gradient Methods
2020/05/13 by Jincheng Mei, Chenjun Xiao, Mei, Jincheng +5 · 24 citations
Computer Science · Decision Sciences · #Stochastic Gradient Optimization Techniques #Reinforcement Learning in Robotics #Advanced Bandit Algorithms Research
- Nearly Minimax Optimal Reinforcement Learning for Linear Mixture Markov Decision Processes
2020/12/15 by Dongruo Zhou, Quanquan Gu, Zhou, Dongruo +3 · 12 citations
Decision Sciences · Computer Science · Engineering · #Advanced Bandit Algorithms Research #Reinforcement Learning in Robotics #Smart Grid Energy Management
- Learning with a Strong Adversary
2015/11/10 by Ruitong Huang, Huang, Ruitong, Bing Xu +5 · 11 citations
Computer Science · #Adversarial Robustness in Machine Learning #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG)
- Online Least Squares Estimation with Self-Normalized Processes: An Application to Bandit Problems
2011/02/14 by Yasin Abbasi-Yadkori, Abbasi-Yadkori, Yasin, Dávid Pál +3 · 7 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Optimization and Search Problems #Reinforcement Learning in Robotics
- Cascading Bandits: Learning to Rank in the Cascade Model
2015/02/10 by Branislav Kveton, Csaba Szepesvári, Kveton, Branislav +5 · 7 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Optimization and Search Problems
- Estimation of R 'enyi Entropy and Mutual Information Based on\n Generalized Nearest-Neighbor Graphs
2010/03/09 by Dávid Pál, Pál, Dávid, Barnabás Póczos +3 · 6 citations
Computer Science · Mathematics · #Artificial Intelligence (cs.AI) #Bayesian Methods and Mixture Models #Blind Source Separation Techniques #FOS: Computer and information sciences #Face and Expression Recognition #Machine Learning (stat.ML) #Statistical Methods and Inference
- When Is Partially Observable Reinforcement Learning Not Scary?
2022/04/19 by Qinghua Liu, Alan Chung, Liu, Qinghua +5 · 10 citations
Computer Science · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Systems and Control (eess.SY) #electronic engineering #information engineering
- Randomized Exploration in Generalized Linear Bandits
2019/06/21 by Branislav Kveton, Manzil Zaheer, Kveton, Branislav +9 · 7 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Stochastic Gradient Optimization Techniques
- Variational Policy Gradient Method for Reinforcement Learning with General Utilities
2020/07/04 by Junyu Zhang, Alec Koppel, Zhang, Junyu +7 · 11 citations
Computer Science · Engineering · #Adaptive Dynamic Programming Control #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Traffic control and management
- Combinatorial Cascading Bandits
2015/07/15 by Branislav Kveton, Kveton, Branislav, Zheng Wen +5 · 7 citations
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Optimization and Search Problems #Reinforcement Learning in Robotics
- Cumulative Prospect Theory Meets Reinforcement Learning: Prediction and\n Control
2015/06/08 by L. A. Prashanth, Jie Cheng, A., Prashanth L. +7 · 6 citations
Decision Sciences · Engineering · Social Sciences · #Decision-Making and Behavioral Economics #FOS: Computer and information sciences #FOS: Mathematics #Machine Learning (cs.LG) #Optimization and Control (math.OC) #Traffic control and management #Transportation Planning and Optimization
- Model-Free Linear Quadratic Control via Reduction to Expert Prediction
2018/04/17 by Yasin Abbasi-Yadkori, Abbasi-Yadkori, Yasin, Nevena Lazic +3 · 12 citations
Decision Sciences · Engineering · Computer Science · #Advanced Bandit Algorithms Research #Smart Grid Energy Management #Reinforcement Learning in Robotics
- PAC-Bayes Analysis Beyond the Usual Bounds
2020/06/23 by Omar Rivasplata, Ilja Kuzborskij, Rivasplata, Omar +5 · 5 citations
Computer Science · Mathematics · #Machine Learning and Algorithms #Gaussian Processes and Bayesian Inference #Statistical Methods and Inference
- Beyond Statistical Learning: Exact Learning Is Essential for General Intelligence
2025/06/30 by András György, Tor Lattimore, György, András +5 · 2 voices · 5 citations
#cs.AI #cs.LG
- Model-Based Reinforcement Learning with Value-Targeted Regression
2020/06/01 by Alex Ayoub, Zeyu Jia, Ayoub, Alex +7 · 10 citations
Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Smart Grid Energy Management
- Dyna-Style Planning with Linear Function Approximation and Prioritized\n Sweeping
2012/06/13 by Richard S. Sutton, Csaba Szepesvári, Sutton, Richard S. +6 · 4 citations
Computer Science · Decision Sciences · #AI-based Problem Solving and Planning #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #FOS: Electrical engineering #Formal Methods in Verification #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robotic Path Planning Algorithms #Systems and Control (eess.SY) #electronic engineering #information engineering
- PAC-Bayesian Policy Evaluation for Reinforcement Learning
2012/02/14 by Mahdi Milani Fard, Joëlle Pineau, Fard, Mahdi MIlani +3 · 3 citations
Computer Science · #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Domain Adaptation and Few-Shot Learning
- Rigorous Agent Evaluation: An Adversarial Approach to Uncover\n Catastrophic Failures
2018/12/04 by Jonathan Uesato, Uesato, Jonathan, Ananya Kumar +15 · 5 citations
Computer Science · #Adversarial Robustness in Machine Learning #Anomaly Detection Techniques and Applications #Explainable Artificial Intelligence (XAI)
- Stochastic Low-Rank Bandits
2017/12/13 by Branislav Kveton, Csaba Szepesvári, Kveton, Branislav +9 · 5 citations
Decision Sciences · Engineering · Computer Science · #Advanced Bandit Algorithms Research #Sparse and Compressive Sensing Techniques #Stochastic Gradient Optimization Techniques
- Multiclass Classification Calibration Functions
2016/09/20 by Bernardo Ávila Pires, Csaba Szepesvári, Pires, Bernardo Ávila +1 · 4 citations
Decision Sciences · Mathematics · Computer Science · #Advanced Statistical Process Monitoring #Advanced Statistical Methods and Models #Imbalanced Data Classification Techniques
- Model Selection in Contextual Stochastic Bandit Problems
2020/03/03 by Aldo Pacchiano, Pacchiano, Aldo, My V. T. Phan +11 · 8 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Sample-Efficient Reinforcement Learning of Partially Observable Markov Games
2022/06/02 by Qinghua Liu, Csaba Szepesvári, Liu, Qinghua +3 · 4 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #Computer Science and Game Theory (cs.GT) #FOS: Computer and information sciences #Game Theory and Applications #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
- PAC-Bayes with Backprop
2019/08/19 by Omar Rivasplata, Rivasplata, Omar, Vikram M Tankasali +3 · 4 citations
Computer Science · #Adversarial Robustness in Machine Learning #Machine Learning and Algorithms #Machine Learning and Data Classification
- Asymptotically Optimal Information-Directed Sampling
2020/11/11 by Johannes Kirschner, Kirschner, Johannes, Tor Lattimore +5 · 3 citations
Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Sparse and Compressive Sensing Techniques
- Bayesian Optimal Control of Smoothly Parameterized Systems: The Lazy\n Posterior Sampling Algorithm
2014/06/16 by Yasin Abbasi-Yadkori, Csaba Szepesvári, Abbasi-Yadkori, Yasin +1 · 3 citations
Computer Science · Decision Sciences · Engineering · Mathematics · #Advanced Bandit Algorithms Research #Advanced Control Systems Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Markov Chains and Monte Carlo Methods #Reinforcement Learning in Robotics
- Near-Optimal Sample Complexity Bounds for Constrained MDPs
2022/06/13 by Sharan Vaswani, Vaswani, Sharan, Lin F. Yang +3 · 4 citations
Computer Science · #Bayesian Modeling and Causal Inference #FOS: Computer and information sciences #Formal Methods in Verification #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms
- Stochastic Rank-1 Bandits
2016/08/10 by Sumeet Katariya, Branislav Kveton, Katariya, Sumeet +7 · 3 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Optimization and Search Problems
- Apprenticeship Learning using Inverse Reinforcement Learning and Gradient Methods
2012/06/20 by Gergely Neu, Csaba Szepesvári, Neu, Gergely +1 · 2 citations
Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and ELM #Reinforcement Learning in Robotics
- LeapsAndBounds: A Method for Approximately Optimal Algorithm\n Configuration
2018/07/02 by Gellért Weisz, Weisz, Gellért, András György +3 · 2 citations
Computer Science · #Advanced Multi-Objective Optimization Algorithms #Artificial Intelligence (cs.AI) #Bayesian Modeling and Causal Inference #FOS: Computer and information sciences #FOS: Mathematics #Formal Methods in Verification #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Machine Learning and Data Classification #Optimization and Control (math.OC)
- Empirical Bayes Regret Minimization
2019/04/04 by Chih‐Wei Hsu, Branislav Kveton, Hsu, Chih-Wei +7 · 3 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- DCM Bandits: Learning to Rank with Multiple Clicks
2016/02/09 by Sumeet Katariya, Branislav Kveton, Katariya, Sumeet +5 · 3 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Optimization and Search Problems #Recommender Systems and Techniques
- The Role of Baselines in Policy Gradient Optimization
2023/01/16 by Jincheng Mei, Mei, Jincheng, Wesley Chung +9 · 3 citations
Computer Science · Economics, Econometrics and Finance · Mathematics · #Artificial Intelligence (cs.AI) #Economic Policies and Impacts #FOS: Computer and information sciences #Machine Learning (cs.LG) #Markov Chains and Monte Carlo Methods #Stochastic Gradient Optimization Techniques
- Exploration via linearly perturbed loss minimisation
2023/11/13 by David M. Janz, Janz, David, Shuai Liu +5 · 4 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Age of Information Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
- Leveraging Non-uniformity in First-order Non-convex Optimization
2021/05/13 by Jincheng Mei, Yue Gao, Mei, Jincheng +7 · 3 citations
Computer Science · Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Sparse and Compressive Sensing Techniques #Stochastic Gradient Optimization Techniques
- Linear Stochastic Approximation: Constant Step-Size and Iterate\n Averaging
2017/09/12 by Chandrashekar Lakshminarayanan, Lakshminarayanan, Chandrashekar, Csaba Szepesvári +1 · 2 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Age of Information Optimization #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Systems and Control (eess.SY) #electronic engineering #information engineering
- On the Optimality of Batch Policy Optimization Algorithms
2021/04/06 by Chenjun Xiao, Xiao, Chenjun, Yifan Wu +13 · 2 citations
Computer Science · Engineering · #Advanced Manufacturing and Logistics Optimization #FOS: Computer and information sciences #Machine Learning (cs.LG) #Optimization and Search Problems #Scheduling and Optimization Algorithms
- Bootstrapping Fitted Q-Evaluation for Off-Policy Inference
2021/02/06 by Botao Hao, Hao, Botao, Xiang Ji +9 · 2 citations
Computer Science · #FOS: Computer and information sciences #FOS: Mathematics #Formal Methods in Verification #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Statistics Theory (math.ST)
- On Multi-objective Policy Optimization as a Tool for Reinforcement Learning: Case Studies in Offline RL and Finetuning
2021/06/15 by Abbas Abdolmaleki, Sandy H. Huang, Abdolmaleki, Abbas +25 · 2 citations
Computer Science · #Advanced Multi-Objective Optimization Algorithms #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robotics (cs.RO)
- On the Convergence and Sample Efficiency of Variance-Reduced Policy Gradient Method
2021/02/17 by Junyu Zhang, Chengzhuo Ni, Zhang, Junyu +7 · 3 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics #Stochastic Gradient Optimization Techniques
- Toward a Classification of Finite Partial-Monitoring Games
2011/02/10 by András Antos, Gábor Bartók, Antos, András +5 · 1 citation
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Revisiting Simple Regret: Fast Rates for Returning a Good Arm
2022/10/30 by Yao Zhao, Connor Stephens, Zhao, Yao +5 · 2 citations
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Algorithms #Stochastic Gradient Optimization Techniques
- Exponential Hardness of Reinforcement Learning with Linear Function Approximation
2023/02/25 by Daniel M. Kane, Sihan Liu, Kane, Daniel +9 · 2 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computational Complexity (cs.CC) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning and Algorithms #Machine Learning and Data Classification #Reinforcement Learning in Robotics
- A Modular Analysis of Adaptive (Non-)Convex Optimization: Optimism, Composite Objectives, and Variational Bounds
2017/09/08 by Pooria Joulani, András György, Joulani, Pooria +3 · 1 citation
Decision Sciences · Engineering · Computer Science · #Advanced Bandit Algorithms Research #Sparse and Compressive Sensing Techniques #Stochastic Gradient Optimization Techniques
- Ensemble sampling for linear bandits: small ensembles suffice
2023/11/14 by David M. Janz, Janz, David, Alexander E. Litvak +3 · 2 citations
Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Mobile Crowdsensing and Crowdsourcing
- Cleaning up the neighborhood: A full classification for adversarial partial monitoring
2018/05/23 by Tor Lattimore, Csaba Szepesvári, Lattimore, Tor +1 · 1 citation
Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Data Stream Mining Techniques #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Distribution-Dependent Analysis of Gibbs-ERM Principle
2019/02/05 by Ilja Kuzborskij, Nicolò Cesa‐Bianchi, Kuzborskij, Ilja +3 · 1 citation
Mathematics · Computer Science · #Markov Chains and Monte Carlo Methods #Gaussian Processes and Bayesian Inference #Machine Learning and Algorithms
- Exponential Lower Bounds for Planning in MDPs With Linearly-Realizable\n Optimal Action-Value Functions
2020/10/03 by Gellért Weisz, Philip Amortila, Weisz, Gellért +3 · 2 citations
Computer Science · #AI-based Problem Solving and Planning #Artificial Intelligence (cs.AI) #Bayesian Modeling and Causal Inference #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Adaptive Exploration in Linear Contextual Bandit
2019/10/15 by Botao Hao, Hao, Botao, Tor Lattimore +3 · 1 citation
Decision Sciences · Engineering · #Advanced Bandit Algorithms Research #FOS: Computer and information sciences #FOS: Mathematics #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Smart Grid Energy Management #Sparse and Compressive Sensing Techniques #Statistics Theory (math.ST)
- A Distribution Dependent Analysis of Meta-Learning
2020/10/31 by Mikhail Konobeev, Konobeev, Mikhail, Ilja Kuzborskij +3 · 1 citation
Computer Science · #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Gaussian Processes and Bayesian Inference #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Data Classification
- Frontier LLMs Still Struggle with Simple Reasoning Tasks
2025/07/09 by Alan Malek, Jayle Ge, Malek, Alan +9 · 5 citations
Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Natural Language Processing Techniques #Text Readability and Simplification #Topic Modeling
- Confident Approximate Policy Iteration for Efficient Local Planning in qπ-realizable MDPs
2022/10/27 by Gellért Weisz, András György, Weisz, Gellért +5 · 1 citation
Computer Science · #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Optimization and Search Problems
- Sample Efficient Deep Reinforcement Learning via Local Planning
2023/01/29 by Dong Yin, Sridhar Thiagarajan, Yin, Dong +9 · 1 voice · 1 citation
Computer Science · #Reinforcement Learning in Robotics #Evolutionary Algorithms and Applications #Artificial Intelligence in Games
- Trajectory Data Suffices for Statistically Efficient Learning in Offline RL with Linear qπ-Realizability and Concentrability
2024/05/27 by V. M. Tkachuk, Gellért Weisz, Tkachuk, Volodymyr +3 · 2 citations
Computer Science · #Machine Learning and Algorithms #Speech and Audio Processing #Target Tracking and Data Fusion in Sensor Networks
- Regret Minimization via Saddle Point Optimization
2024/03/15 by Johannes Kirschner, Seyed Alireza Bakhtiari, Kirschner, Johannes +7 · 1 citation
Engineering · Computer Science · #Advanced Numerical Analysis Techniques #Advanced Multi-Objective Optimization Algorithms #Advanced Measurement and Metrology Techniques
- Autonomous exploration for navigating in non-stationary CMPs
2019/10/18 by Pratik Gajane, Ronald Ortner, Gajane, Pratik +5 · 1 citation
Computer Science · #Data Stream Mining Techniques #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning and Algorithms #Reinforcement Learning in Robotics
- Switching the Loss Reduces the Cost in Batch (Offline) Reinforcement Learning
2024/03/08 by Alex Ayoub, Ayoub, Alex, Kaiwen Wang +13 · 2 citations
Business, Management and Accounting · Computer Science · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Supply Chain and Inventory Management