CoursesMachine Learning

Machine LearningIntermediateSelf-paced

Reinforcement Learning

This course covers the fundamentals and advanced topics in Reinforcement Learning, including tabular and approximate solution methods, and applications. It provides a comprehensive understanding of the Reinforcement Learning problem and various techniques to solve it. Students will learn about key concepts such as Markov Decision Processes, Dynamic Programming, and Policy Gradient Methods.

See the syllabus
0chapters
0modules
0lessons
0quizzes

Syllabus

133 chapters, 350 modules, 797 lessons and quizzes.

  1. 01Getting Started1 modules · 2 lessons
  2. 02Understanding Reinforcement Learning Limitations and Scope3 modules · 6 lessons
  3. 03The k-Armed Bandit Problem: Balancing Exploration and Exploitation2 modules · 5 lessons
  4. 04Efficient Action-Value Estimation2 modules · 4 lessons
  5. 05Handling Nonstationary Problems in Reinforcement Learning3 modules · 6 lessons
  6. 06Optimistic Initial Values for Exploration2 modules · 5 lessons
  7. 07Balancing Exploration and Exploitation with Upper-Confidence-Bound Action Selection2 modules · 5 lessons
  8. 08Gradient Bandit Algorithms for Action Selection2 modules · 6 lessons
  9. 09Defining Goals and Rewards in Reinforcement Learning2 modules · 4 lessons
  10. 10Understanding Returns in Reinforcement Learning4 modules · 7 lessons
  11. 11Unified Notation for Episodic and Continuing Tasks2 modules · 4 lessons
  12. 12Markov Decision Processes and Value Functions2 modules · 7 lessons
  13. 13Understanding Notation in Reinforcement Learning3 modules · 7 lessons
  14. 14Optimal Value Functions in Reinforcement Learning4 modules · 9 lessons
  15. 15Optimality and Approximation in Reinforcement Learning2 modules · 4 lessons
  16. 16Reinforcement Learning Essentials4 modules · 9 lessons
  17. 17Evaluating Policies through Iterative Computation3 modules · 7 lessons
  18. 18Generalized Policy Iteration: A Unified Framework2 modules · 4 lessons
  19. 19Dynamic Programming Essentials2 modules · 8 lessons
  20. 20Estimating Action Values with Monte Carlo Methods2 modules · 5 lessons
  21. 21Monte Carlo Control Methods3 modules · 6 lessons
  22. 22Monte Carlo Methods Summary3 modules · 7 lessons
  23. 23Advantages of Temporal Difference Prediction Methods2 modules · 6 lessons
  24. 24Understanding TD(0) Optimality3 modules · 5 lessons
  25. 25Expected Sarsa: Improving TD Control2 modules · 5 lessons
  26. 26Special Cases in Reinforcement Learning: Afterstates and Games2 modules · 5 lessons
  27. 27Temporal-Difference Learning Methods: n-step and Off-policy Learning2 modules · 5 lessons
  28. 28Understanding Models and Planning in Reinforcement Learning2 modules · 7 lessons
  29. 29Integrating Planning and Learning with Dyna3 modules · 5 lessons
  30. 30Dealing with Modeling Errors in Planning3 modules · 5 lessons
  31. 31Prioritized Sweeping for Efficient Planning3 modules · 9 lessons
  32. 32Planning in Action Selection2 modules · 4 lessons
  33. 33Heuristic Search in Reinforcement Learning2 modules · 5 lessons
  34. 34Monte Carlo Tree Search for Planning3 modules · 8 lessons
  35. 35Integrating Planning and Learning2 modules · 6 lessons
  36. 36Approximate Solutions for Large State Spaces3 modules · 6 lessons
  37. 37Introduction to Value-Function Approximation2 modules · 4 lessons
  38. 38Defining the Prediction Objective in Reinforcement Learning3 modules · 7 lessons
  39. 39Feature Construction for Linear Function Approximation5 modules · 15 lessons
  40. 40Nonlinear Function Approximation with Artificial Neural Networks4 modules · 9 lessons
  41. 41Generalization and Function Approximation in Reinforcement Learning3 modules · 8 lessons
  42. 42Stochastic and Semi-gradient Methods for Value Prediction3 modules · 7 lessons
  43. 43Episodic Semi-gradient Control Methods2 modules · 5 lessons
  44. 44Limitations of Discounted Setting in Continuing Problems2 modules · 3 lessons
  45. 45Extending Off-Policy Algorithms with Semi-Gradient Methods2 modules · 6 lessons
  46. 46Understanding Instability in Semi-Gradient Methods2 modules · 5 lessons
  47. 47Understanding the Deadly Triad in Reinforcement Learning1 modules · 3 lessons
  48. 48Online Forward View for λ-Return Algorithm3 modules · 6 lessons
  49. 49Dutch Traces in Monte Carlo Learning2 modules · 5 lessons
  50. 50Understanding Policy Gradient Theorem2 modules · 6 lessons
  51. 51REINFORCE: A Monte Carlo Policy Gradient Method2 modules · 5 lessons
  52. 52Actor-Critic Methods for Reinforcement Learning3 modules · 4 lessons
  53. 53REINFORCE with Baseline: Reducing Variance in Policy Gradient Methods2 modules · 5 lessons
  54. 54Policy Gradient Methods for Continuing Problems3 modules · 5 lessons
  55. 55Policy Parameterization for Continuous Actions1 modules · 4 lessons
  56. 56Beyond the Basics: Exploring Reinforcement Learning Frontiers3 modules · 6 lessons
  57. 57Understanding Reinforcement Learning Terminology1 modules · 6 lessons
  58. 58Evolution of Reinforcement Learning3 modules · 6 lessons
  59. 59Introduction to Reinforcement Learning5 modules · 10 lessons
  60. 60Reinforcement Learning Through Real-World Examples3 modules · 8 lessons
  61. 61Key Components of Reinforcement Learning1 modules · 5 lessons
  62. 62Tic-Tac-Toe: A Reinforcement Learning Example3 modules · 7 lessons
  63. 63Temporal Difference Prediction Methods3 modules · 5 lessons
  64. 64Reward Prediction Error Hypothesis Explained2 modules · 5 lessons
  65. 65Reinforcement Learning Summary1 modules · 4 lessons
  66. 66Bibliographical Remarks and Further Reading2 modules · 6 lessons
  67. 67Associative Search and Contextual Bandits1 modules · 3 lessons
  68. 68Understanding the Agent-Environment Interaction2 modules · 5 lessons
  69. 69Asynchronous Dynamic Programming for Efficient Reinforcement Learning2 modules · 5 lessons
  70. 70Efficiency of Dynamic Programming Methods1 modules · 4 lessons
  71. 71Temporal-Difference Learning Summary4 modules · 7 lessons
  72. 72Q-learning: Mastering Off-Policy TD Control3 modules · 5 lessons
  73. 73Understanding Maximization Bias and Double Learning2 modules · 5 lessons
  74. 74n-Step Sarsa for Control and Prediction3 modules · 4 lessons
  75. 75Off-policy Learning with n-step Tree Backup3 modules · 6 lessons
  76. 76n-Step Differential Semi-gradient Sarsa2 modules · 4 lessons
  77. 77n-Step Semi-Gradient Sarsa for Control3 modules · 5 lessons
  78. 78Average Reward Setting for Continuing Tasks2 modules · 6 lessons
  79. 79Average Reward Formulation and Semi-gradient Methods2 modules · 5 lessons
  80. 80Prediction and Control in Reinforcement Learning2 modules · 5 lessons
  81. 81Classical Conditioning: Learning Predictive Relationships4 modules · 7 lessons
  82. 82Instrumental Conditioning and Reinforcement Learning4 modules · 9 lessons
  83. 83Understanding Delayed Reinforcement in Learning3 modules · 7 lessons
  84. 84n-Step TD Prediction Methods3 modules · 6 lessons
  85. 85Unifying n-step Action-Value Backups with Q(σ)2 modules · 5 lessons
  86. 86Linear Methods for Function Approximation3 modules · 6 lessons
  87. 87Understanding the λ-return in Reinforcement Learning2 modules · 5 lessons
  88. 88Tabular Solution Methods in Reinforcement Learning4 modules · 8 lessons
  89. 89Action-Value Methods for Decision Making3 modules · 5 lessons
  90. 90Balancing Exploration and Exploitation3 modules · 8 lessons
  91. 91Introduction to Monte Carlo Prediction4 modules · 9 lessons
  92. 92Monte Carlo Control without Exploring Starts2 modules · 4 lessons
  93. 93Policy Improvement Techniques3 modules · 6 lessons
  94. 94Policy Iteration for Optimal Decision Making3 modules · 8 lessons
  95. 95Value Iteration for Optimal Policies3 modules · 6 lessons
  96. 96Off-policy Prediction with Importance Sampling3 modules · 6 lessons
  97. 97Incremental Monte Carlo Methods2 modules · 5 lessons
  98. 98Off-Policy Monte Carlo Control Methods3 modules · 5 lessons
  99. 99Sarsa: On-Policy TD Control for Reinforcement Learning3 modules · 6 lessons
  100. 100Off-policy Learning with n-step Methods2 modules · 5 lessons
  101. 101Least-Squares TD: Efficient Linear TD(0)3 modules · 6 lessons
  102. 102TD(λ) Algorithm and Eligibility Traces4 modules · 6 lessons
  103. 103True Online TD(λ) for Efficient Learning3 modules · 5 lessons
  104. 104Policy Approximation and its Benefits2 modules · 4 lessons
  105. 105Understanding Cognitive Maps in Reinforcement Learning3 modules · 5 lessons
  106. 106Habitual vs Goal-Directed Behavior in Reinforcement Learning3 modules · 6 lessons
  107. 107Reinforcement Learning and Animal Learning5 modules · 9 lessons
  108. 108Reinforcement Learning and Animal Learning1 modules · 2 lessons
  109. 109Historical Context and Influences on Reinforcement Learning3 modules · 7 lessons
  110. 110Foundations of Neuroscience for Reinforcement Learning3 modules · 7 lessons
  111. 111Understanding Reward and Reinforcement Signals in Reinforcement Learning3 modules · 6 lessons
  112. 112Dopamine's Role in Reward Processing and Reinforcement Learning3 modules · 7 lessons
  113. 113Experimental Evidence for Reward Prediction Error Hypothesis2 modules · 4 lessons
  114. 114TD Error and Dopamine Neuron Activity Correspondence1 modules · 6 lessons
  115. 115Neural Actor-Critic Algorithms3 modules · 6 lessons
  116. 116Actor and Critic Learning Rules Explained1 modules · 7 lessons
  117. 117Hedonistic Neurons and Reinforcement Learning3 modules · 5 lessons
  118. 118Collective Reinforcement Learning in Multi-Agent Systems4 modules · 7 lessons
  119. 119Model-Based Reinforcement Learning in the Brain3 modules · 6 lessons
  120. 120Understanding Addiction through Reinforcement Learning2 modules · 7 lessons
  121. 121Reinforcement Learning and Neuroscience3 modules · 8 lessons
  122. 122Reinforcement Learning and Neuroscience Convergence1 modules · 4 lessons
  123. 123Bibliographical and Historical Remarks on Reinforcement Learning3 modules · 8 lessons
  124. 124TD-Gammon: A Reinforcement Learning Application to Backgammon3 modules · 9 lessons
  125. 125Samuel's Checkers Player: A Pioneer in Reinforcement Learning3 modules · 9 lessons
  126. 126Acrobot Control with Reinforcement Learning3 modules · 5 lessons
  127. 127Watson's Daily-Double Wagering Strategy3 modules · 8 lessons
  128. 128Optimizing Memory Control with Reinforcement Learning4 modules · 6 lessons
  129. 129Achieving Human-Level Performance in Video Games with Deep Reinforcement Learning4 modules · 9 lessons
  130. 130Mastering Go: AlphaGo's Breakthrough3 modules · 9 lessons
  131. 131Personalizing Web Services with Reinforcement Learning5 modules · 8 lessons
  132. 132Thermal Soaring: Exploiting Rising Air Currents5 modules · 8 lessons
  133. 133Exploring the Frontiers of Reinforcement Learning1 modules · 5 lessons

Start Reinforcement Learning today.

Free for you right now.

Reinforcement Learning