vix.ing · top · new · best · stats · spec

Matthieu Geist

  1. On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes
    2023/06/23 by Rishabh Agarwal, Agarwal, Rishabh, Nino Vieillard +12 · 2 voices · 80 citations
    Computer Science · #Natural Language Processing Techniques #Topic Modeling #cs.AI #cs.CL #cs.LG
  2. Gemini: A Family of Highly Capable Multimodal Models
    2023/12/19 by Gemini Robotics Team, Rohan Anil, Gemini Team +2692 · 9 voices · 6 citations
    Computer Science · #Artificial Intelligence (cs.AI) #Computation and Language (cs.CL) #Computer Vision and Pattern Recognition (cs.CV) #FOS: Computer and information sciences #Multimodal Machine Learning Applications #Natural Language Processing Techniques #cs.AI #cs.CL #cs.CV
  3. Nash Learning from Human Feedback
    2023/12/01 by Rémi Munos, Munos, Rémi, Michal Valko +31 · 1 voice · 26 citations
    #stat.ML #cs.AI #cs.GT #cs.LG #cs.MA
  4. Extreme Q-Learning: MaxEnt RL without Entropy
    2023/01/05 by Divyansh Garg, Joey Hejna, Garg, Divyansh +5 · 19 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robotics (cs.RO)
  5. Primal Wasserstein Imitation Learning
    2020/06/08 by Robert Dadashi, Dadashi, Robert, Léonard Hussenot +5 · 11 citations
    Computer Science · #Adversarial Robustness in Machine Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Multimodal Machine Learning Applications #Reinforcement Learning in Robotics
  6. What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study
    2020/06/10 by Marcin Andrychowicz, Andrychowicz, Marcin, Anton Raichuk +21 · 10 citations
    Computer Science · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Mobile Crowdsensing and Crowdsourcing #Reinforcement Learning in Robotics #Software Engineering Research
  7. Learning in Mean Field Games: A Survey
    2022/05/25 by Mathieu Laurière, Laurière, Mathieu, Sarah Perrin +13 · 1 voice · 9 citations
    Economics, Econometrics and Finance · #Sports Analytics and Performance #cs.AI #cs.GT #cs.LG #math.OC
  8. NatureLM-audio: an Audio-Language Foundation Model for Bioacoustics
    2024/11/11 by David Robinson, Marius Miron, Robinson, David +15 · 2 voices · 13 citations
    #cs.SD #cs.AI #cs.LG #eess.AS
  9. Fictitious Play for Mean Field Games: Continuous Time Analysis and\n Applications
    2020/07/05 by Sarah Perrin, Perrin, Sarah, Julien Pérolat +9 · 8 citations
    Decision Sciences · Computer Science · #Advanced Bandit Algorithms Research #Game Theory and Applications #Reinforcement Learning in Robotics
  10. A Survey of Temporal Credit Assignment in Deep Reinforcement Learning
    2023/12/02 by Eduardo Pignatelli, Johan Ferret, Pignatelli, Eduardo +9 · 11 citations
    Computer Science · #Reinforcement Learning in Robotics
  11. What Matters for Adversarial Imitation Learning?
    2021/06/01 by Manu Orsini, Anton Raichuk, Orsini, Manu +17 · 5 citations
    Computer Science · Engineering · #Adversarial Robustness in Machine Learning #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Neural and Evolutionary Computing (cs.NE) #Reinforcement Learning in Robotics #Robot Manipulation and Learning
  12. Scalable Deep Reinforcement Learning Algorithms for Mean Field Games
    2022/03/22 by Mathieu Laurière, Laurière, Mathieu, Sarah Perrin +19 · 6 citations
    Decision Sciences · Economics, Econometrics and Finance · #FOS: Computer and information sciences #FOS: Mathematics #Game Theory and Applications #Innovation Diffusion and Forecasting #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Optimization and Control (math.OC) #Sports Analytics and Performance
  13. Policy Gradient for Rectangular Robust Markov Decision Processes
    2023/01/31 by Navdeep Kumar, Kumar, Navdeep, Esther Derman +7 · 5 citations
    Computer Science · #Age of Information Optimization #Artificial Intelligence (cs.AI) #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics
  14. Self-Improving Robust Preference Optimization
    2024/06/03 by Eugene Choi, Arash Ahmadian, Choi, Eugene +7 · 7 citations
    Decision Sciences · #Multi-Criteria Decision Making
  15. Command A: An Enterprise-Ready Large Language Model
    2025/04/01 by Team Cohere, Cohere, Team, : +316 · 12 citations
    Business, Management and Accounting · Computer Science · #Business Process Modeling and Analysis #Software System Performance and Reliability #Advanced Software Engineering Methodologies
  16. A general class of surrogate functions for stable and efficient reinforcement learning
    2021/08/12 by Sharan Vaswani, Vaswani, Sharan, Olivier Bachem +15 · 3 citations
    Computer Science · Decision Sciences · #Adaptive Dynamic Programming Control #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  17. CopyCAT: Taking Control of Neural Policies with Constant Attacks
    2019/05/29 by Léonard Hussenot, Hussenot, Léonard, Matthieu Geist +3 · 3 citations
    Computer Science · #Adversarial Robustness in Machine Learning #Reinforcement Learning in Robotics #Explainable Artificial Intelligence (XAI)
  18. Contrastive Policy Gradient: Aligning LLMs on sequence-level scores in a supervised-friendly fashion
    2024/06/27 by Yannis Flet-Berliac, Nathan Grinsztajn, Flet-Berliac, Yannis +18 · 5 citations
    Decision Sciences · #Educational Assessment and Improvement
  19. Leverage the Average: an Analysis of KL Regularization in RL
    2020/03/31 by Nino Vieillard, Tadashi Kozuno, Vieillard, Nino +9 · 2 citations
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Advanced Bandit Algorithms Research #Adaptive Dynamic Programming Control
  20. Scaling up Mean Field Games with Online Mirror Descent
    2021/02/28 by Julien Pérolat, Sarah Perrin, Perolat, Julien +13 · 2 citations
    Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Artificial Intelligence (cs.AI) #Artificial Intelligence in Games #FOS: Computer and information sciences #Reinforcement Learning in Robotics
  21. There Is No Turning Back: A Self-Supervised Approach for Reversibility-Aware Reinforcement Learning
    2021/06/08 by Nathan Grinsztajn, Grinsztajn, Nathan, Johan Ferret +6 · 2 citations
    Computer Science · #Reinforcement Learning in Robotics #Explainable Artificial Intelligence (XAI) #Data Stream Mining Techniques
  22. On Imitation in Mean-field Games
    2023/06/26 by Giorgia Ramponi, Pavel Kolev, Ramponi, Giorgia +9 · 3 citations
    Computer Science · Social Sciences · #Reinforcement Learning in Robotics #Experimental Behavioral Economics Studies
  23. Closing the Gap between TD Learning and Supervised Learning -- A Generalisation Point of View
    2024/01/20 by Raj Ghugare, Ghugare, Raj, Matthieu Geist +5 · 4 citations
    Computer Science · #Evolutionary Algorithms and Applications #Reinforcement Learning in Robotics #Machine Learning and Data Classification
  24. Twice regularized MDPs and the equivalence between robustness and regularization
    2021/10/12 by Esther Derman, Matthieu Geist, Derman, Esther +3 · 2 citations
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Adversarial Robustness in Machine Learning #Advanced Bandit Algorithms Research
  25. Learning Energy Networks with Generalized Fenchel-Young Losses
    2022/05/19 by Mathieu Blondel, Blondel, Mathieu, Felipe Llinares-López +7 · 2 citations
    Computer Science · Materials Science · #Advanced Neural Network Applications #Domain Adaptation and Few-Shot Learning #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Machine Learning in Materials Science
  26. Policy Mirror Ascent for Efficient and Independent Learning in Mean Field Games
    2022/12/29 by Batuhan Yardim, Yardim, Batuhan, Semih Çaycı +5 · 2 citations
    Decision Sciences · Computer Science · Physics and Astronomy · #Advanced Bandit Algorithms Research #Stochastic Gradient Optimization Techniques #Quantum many-body systems
  27. Off-policy Learning with Eligibility Traces: A Survey
    2013/04/15 by Matthieu Geist, Bruno Scherrer, Geist, Matthieu +1 · 1 citation
    Computer Science · Decision Sciences · #Reinforcement Learning in Robotics #Gaussian Processes and Bayesian Inference #Advanced Bandit Algorithms Research
  28. Imitating Language via Scalable Inverse Reinforcement Learning
    2024/09/02 by Markus Wulfmeier, Wulfmeier, Markus, Michael Bloesch +29 · 3 citations
    Computer Science · Engineering · #Reinforcement Learning in Robotics #Evolutionary Algorithms and Applications #Modular Robots and Swarm Intelligence
  29. Momentum in Reinforcement Learning
    2019/10/21 by Nino Vieillard, Bruno Scherrer, Vieillard, Nino +5 · 1 citation
    Computer Science · Decision Sciences · #Advanced Bandit Algorithms Research #Evolutionary Algorithms and Applications #FOS: Computer and information sciences #Machine Learning (cs.LG) #Machine Learning (stat.ML) #Reinforcement Learning in Robotics
  30. Learning Discrete-Time Major-Minor Mean Field Games
    2023/12/17 by Kai Cui, Cui, Kai, Gökçe Dayanıklı +9 · 3 citations
    Decision Sciences · Economics, Econometrics and Finance · Social Sciences · #Computer Science and Game Theory (cs.GT) #Experimental Behavioral Economics Studies #FOS: Computer and information sciences #FOS: Mathematics #Game Theory and Applications #Machine Learning (cs.LG) #Multiagent Systems (cs.MA) #Optimization and Control (math.OC) #Sports Analytics and Performance
  31. Self-Imitation Advantage Learning
    2020/12/22 by Johan Ferret, Ferret, Johan, Olivier Pietquin +3 · 1 citation
    Computer Science · #Adaptive Dynamic Programming Control #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics
  32. Adversarially Guided Actor-Critic
    2021/02/08 by Yannis Flet-Berliac, Johan Ferret, Flet-Berliac, Yannis +6 · 1 citation
    Computer Science · #Adversarial Robustness in Machine Learning #Reinforcement Learning in Robotics #Explainable Artificial Intelligence (XAI)
  33. Learning Correlated Equilibria in Mean-Field Games
    2022/08/22 by Paul Müller, Romuald Élie, Muller, Paul +17 · 1 citation
    Decision Sciences · Economics, Econometrics and Finance · Physics and Astronomy · #Advanced Thermodynamics and Statistical Mechanics #Computer Science and Game Theory (cs.GT) #Economic theories and models #FOS: Computer and information sciences #Game Theory and Applications #Machine Learning (stat.ML)
  34. Get Back Here: Robust Imitation by Return-to-Distribution Planning
    2023/05/02 by Geoffrey Cideron, Baruch Tabanpour, Cideron, Geoffrey +15 · 1 citation
    Computer Science · Engineering · #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #FOS: Electrical engineering #Machine Learning (cs.LG) #Machine Learning and Algorithms #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotics (cs.RO) #Systems and Control (eess.SY) #electronic engineering #information engineering
  35. A Connection between One-Step Regularization and Critic Regularization in Reinforcement Learning
    2023/07/24 by Benjamin Eysenbach, Matthieu Geist, Eysenbach, Benjamin +5 · 1 citation
    Computer Science · Engineering · #Adaptive Dynamic Programming Control #Artificial Intelligence (cs.AI) #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Smart Grid Energy Management
  36. RRLS : Robust Reinforcement Learning Suite
    2024/06/12 by Adil Zouitine, David Bertoin, Zouitine, Adil +7 · 1 citation
    Computer Science · Engineering · #FOS: Computer and information sciences #Machine Learning (cs.LG) #Reinforcement Learning in Robotics #Robot Manipulation and Learning #Robotic Path Planning Algorithms
  37. ShiQ: Bringing back Bellman to LLMs
    2025/05/16 by Pierre Clavier, Clavier, Pierre, Nathan Grinsztajn +19 · 2 citations
    Medicine · Computer Science · #Artificial Intelligence in Healthcare and Education #Topic Modeling #Natural Language Processing Techniques
  38. RoboRAN: A Unified Robotics Framework for Reinforcement Learning-Based Autonomous Navigation
    2025/05/20 by Matteo El-Hariry, Antoine Richard, El-Hariry, Matteo +11 · 2 citations
    Computer Science · #Robotic Path Planning Algorithms #Reinforcement Learning in Robotics