Geschreven door studenten die geslaagd zijn Direct beschikbaar na je betaling Online lezen of als PDF Verkeerd document? Gratis ruilen 4,6 TrustPilot
logo-home
College aantekeningen

Formula Sheet RL & Deep Learning | Lectures 1-6 | UvA | 2025/26

Beoordeling
-
Verkocht
-
Pagina's
11
Geüpload op
24-05-2026
Geschreven in
2025/2026

Formula sheet for Reinforcement and Deep Learning course at the University of Amsterdam, covering all essential equations and derivations from the first six lectures. Topics include MDPs and Bellman equations, dynamic programming, Monte Carlo methods, policy gradients, actor-critic algorithms, and deep RL with RLHF. This is an invaluable resource for exam preparation and quick reference during problem-solving—all key formulas organized by lecture for efficient studying.

Meer zien Lees minder

Voorbeeld van de inhoud

RL & Deep Learning: Formula Sheet
Lecture 1 – Lecture 6

Lecture 1: MDPs & Bellman Equations
Dynamics of the Environment (Transition Probability)




Figure 1: Agent-interaction interface

Conditional probability
.
p(s′ , r|s, a) = Pr[St+1 = s′ , Rt+1 = r|St = s, At = a]
State-Transition Probabilities
. X
p(s′ |s, a) = Pr[St+1 = s′ |St = s, At = a] = p(s′ , r|s, a)
r∈R

Expected Rewards for State-Action Pairs
. X X
r(s, a) = E[Rt+1 |St = s, At = a] = r p(s′ , r|s, a)
r∈R s′ ∈S

Expected Rewards for State-Action-NextState Triplets

. X p(s′ , r|s, a)
r(s, a, s′ ) = E[Rt+1 |St = s, At = a, St+1 = s′ ] = r
p(s′ |s, a)
r∈R

Episodic task

. X
Gt = Rt+1 + Rt+2 + Rt+3 + · · · = Rt
k=0

Discounted Return

. X
Gt = Rt+1 + γRt+2 + γ 2 Rt+3 + · · · = γ k Rt+k+1
k=0

Policy Definition
.
π(a|s) = Pr[At = a|St = s]
State-Value Function (vπ )
"∞ #
. X
vπ (s) = Eπ [Gt |St = s] = Eπ γ k Rt+k+1 | St = s , ∀s ∈ S
k=0

Action-Value Function (qπ )
.
qπ (s, a) = Eπ [Gt | St = s, At = a], ∀s ∈ S, ∀a ∈ A(s)

Bellman Equation for State-Value Function (Derivation)



1

, .
vπ (s) = Eπ [Gt | St = s]

= Eπ [Rt+1 + γGt+1 | St = s]
X
= π(a|s)Eπ [Rt+1 + γGt+1 | St = s, At = a]
a∈A(s)
X X
p(s′ , r | s, a) r + γEπ [Gt+1 | St+1 = s′ ]
 
= π(a|s)
a s′ ,r
X X
= π(a|s) p(s′ , r | s, a)[r + γvπ (s′ )]
a s′ ,r


Bellman Equation for Action-Value Function (Derivation)

.
qπ (s, a) = Eπ [Gt | St = s, At = a]

= Eπ [Rt+1 + γGt+1 | St = s, At = a]
X
p(s′ , r | s, a) r + γEπ [Gt+1 | St+1 = s′ ]
 
=
s′ ,r
 
X X
= p(s′ , r | s, a) r + γ π(a′ |s′ )Eπ [Gt+1 | St+1 = s′ , At+1 = a′ ]
s′ ,r a′ ∈A(s′ )
X X
= p(s′ , r | s, a) π(a′ |s′ )[r + γqπ (s′ , a′ )]
s′ ,r a′ ∈A(s′ )


Policy Comparison (Condition for a ”Better” Policy)

π ≥ π̃ ⇐⇒ vπ (s) ≥ vπ̃ (s), ∀s ∈ S

Optimal State-Value Function (v∗ )
.
v∗ (s) = max vπ (s), ∀s ∈ S
π

Optimal Action-Value Function (q∗ )
.
q∗ (s, a) = max qπ (s, a), ∀s ∈ S, ∀a ∈ A(s)
π

Bellman Optimality Equation for State-Value Function (v∗ ) (Derivation)


v∗ (s) = max q∗ (s, a)
a∈A(s)

= max E[Rt+1 + γv∗ (St+1 ) | St = s, At = a]
a
X
= max p(s′ , r | s, a)[r + γv∗ (s′ )]
a
s′ ,r


Bellman Optimality Equation for Action-Value Function (q∗ ) (Derivation)

q∗ (s, a) = E[Rt+1 + γv∗ (St+1 ) | St = s, At = a]
= E[Rt+1 + γ max q∗ (St+1 , a′ ) | St = s, At = a]
a′
X  
′ ′ ′
= p(s , r | s, a) r + γ max ′
q∗ (s , a )
a
s′ ,r


2

Documentinformatie

Geüpload op
24 mei 2026
Aantal pagina's
11
Geschreven in
2025/2026
Type
College aantekeningen
Docent(en)
Bram wouters
Bevat
Alle colleges
€7,49
Krijg toegang tot het volledige document:

Verkeerd document? Gratis ruilen Binnen 14 dagen na aankoop en voor het downloaden kun je een ander document kiezen. Je kunt het bedrag gewoon opnieuw besteden.
Geschreven door studenten die geslaagd zijn
Direct beschikbaar na je betaling
Online lezen of als PDF

Maak kennis met de verkoper
Seller avatar
polinastepanova

Maak kennis met de verkoper

Seller avatar
polinastepanova Universiteit van Amsterdam
Bekijk profiel
Volgen Je moet ingelogd zijn om studenten of vakken te kunnen volgen
Verkocht
-
Lid sinds
18 uur
Aantal volgers
0
Documenten
1
Laatst verkocht
-

0,0

0 beoordelingen

5
0
4
0
3
0
2
0
1
0

Recent door jou bekeken

Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via iDeal of creditcard en download je PDF-document meteen.

Student with book image

“Gekocht, gedownload en geslaagd. Zo makkelijk kan het dus zijn.”

Alisha Student

Bezig met je bronvermelding?

Maak nauwkeurige citaten in APA, MLA en Harvard met onze gratis bronnengenerator.

Bezig met je bronvermelding?

Veelgestelde vragen