R. J. Chen
- DeepSeek-R1 incentivizes reasoning in LLMs through reinforcement learning
DeepSeek-R1 shows an LLM can learn strong step-by-step reasoning from pure reinforcement learning, with no human-labeled reasoning examples.
2025/01/22 by DeepSeek-AI, Daya Guo, Guo, Daya +404 · 93 voices · 2,970 citations
Computer Science · #Automated reasoning #Case-based reasoning #Coding (social sciences) #Data Stream Mining Techniques #Explainable Artificial Intelligence (XAI) #Non-monotonic logic #Reasoning system #Reinforcement Learning in Robotics #Reinforcement learning #Verbal reasoning #Verifiable secret sharing