College aantekeningen

Formula Sheet RL & Deep Learning | Lectures 1-6 | UvA | 2025/26

Beoordeling

Verkocht

Pagina's

Geüpload op

24-05-2026

Geschreven in

2025/2026

Formula sheet for Reinforcement and Deep Learning course at the University of Amsterdam, covering all essential equations and derivations from the first six lectures. Topics include MDPs and Bellman equations, dynamic programming, Monte Carlo methods, policy gradients, actor-critic algorithms, and deep RL with RLHF. This is an invaluable resource for exam preparation and quick reference during problem-solving—all key formulas organized by lecture for efficient studying.

Meer zien Lees minder

Instelling

Vak

Voorbeeld van de inhoud

RL & Deep Learning: Formula Sheet
Lecture 1 – Lecture 6

Lecture 1: MDPs & Bellman Equations
Dynamics of the Environment (Transition Probability)

Figure 1: Agent-interaction interface

Conditional probability
.
p(s′ , r|s, a) = Pr[St+1 = s′ , Rt+1 = r|St = s, At = a]
State-Transition Probabilities
. X
p(s′ |s, a) = Pr[St+1 = s′ |St = s, At = a] = p(s′ , r|s, a)
r∈R

Expected Rewards for State-Action Pairs
. X X
r(s, a) = E[Rt+1 |St = s, At = a] = r p(s′ , r|s, a)
r∈R s′ ∈S

Expected Rewards for State-Action-NextState Triplets

. X p(s′ , r|s, a)
r(s, a, s′ ) = E[Rt+1 |St = s, At = a, St+1 = s′ ] = r
p(s′ |s, a)
r∈R

Episodic task
∞
. X
Gt = Rt+1 + Rt+2 + Rt+3 + · · · = Rt
k=0

Discounted Return
∞
. X
Gt = Rt+1 + γRt+2 + γ 2 Rt+3 + · · · = γ k Rt+k+1
k=0

Policy Definition
.
π(a|s) = Pr[At = a|St = s]
State-Value Function (vπ )
"∞ #
. X
vπ (s) = Eπ [Gt |St = s] = Eπ γ k Rt+k+1 | St = s , ∀s ∈ S
k=0

Action-Value Function (qπ )
.
qπ (s, a) = Eπ [Gt | St = s, At = a], ∀s ∈ S, ∀a ∈ A(s)

Bellman Equation for State-Value Function (Derivation)

1

, .
vπ (s) = Eπ [Gt | St = s]

= Eπ [Rt+1 + γGt+1 | St = s]
X
= π(a|s)Eπ [Rt+1 + γGt+1 | St = s, At = a]
a∈A(s)
X X
p(s′ , r | s, a) r + γEπ [Gt+1 | St+1 = s′ ]

= π(a|s)
a s′ ,r
X X
= π(a|s) p(s′ , r | s, a)[r + γvπ (s′ )]
a s′ ,r

Bellman Equation for Action-Value Function (Derivation)

.
qπ (s, a) = Eπ [Gt | St = s, At = a]

= Eπ [Rt+1 + γGt+1 | St = s, At = a]
X
p(s′ , r | s, a) r + γEπ [Gt+1 | St+1 = s′ ]

=
s′ ,r
 
X X
= p(s′ , r | s, a) r + γ π(a′ |s′ )Eπ [Gt+1 | St+1 = s′ , At+1 = a′ ]
s′ ,r a′ ∈A(s′ )
X X
= p(s′ , r | s, a) π(a′ |s′ )[r + γqπ (s′ , a′ )]
s′ ,r a′ ∈A(s′ )

Policy Comparison (Condition for a ”Better” Policy)

π ≥ π̃ ⇐⇒ vπ (s) ≥ vπ̃ (s), ∀s ∈ S

Optimal State-Value Function (v∗ )
.
v∗ (s) = max vπ (s), ∀s ∈ S
π

Optimal Action-Value Function (q∗ )
.
q∗ (s, a) = max qπ (s, a), ∀s ∈ S, ∀a ∈ A(s)
π

Bellman Optimality Equation for State-Value Function (v∗ ) (Derivation)

v∗ (s) = max q∗ (s, a)
a∈A(s)

= max E[Rt+1 + γv∗ (St+1 ) | St = s, At = a]
a
X
= max p(s′ , r | s, a)[r + γv∗ (s′ )]
a
s′ ,r

Bellman Optimality Equation for Action-Value Function (q∗ ) (Derivation)

q∗ (s, a) = E[Rt+1 + γv∗ (St+1 ) | St = s, At = a]
= E[Rt+1 + γ max q∗ (St+1 , a′ ) | St = s, At = a]
a′
X
′ ′ ′
= p(s , r | s, a) r + γ max ′
q∗ (s , a )
a
s′ ,r

2

Meld schending auteursrecht

Geschreven voor

Instelling: Universiteit van Amsterdam (UvA)
Studie: Data Science
Vak: Reinforcement and Deep Learning

Alle documenten voor dit vak (1)

Documentinformatie

Geüpload op: 24 mei 2026
Aantal pagina's: 11
Geschreven in: 2025/2026
Type: College aantekeningen
Docent(en): Bram wouters
Bevat: Alle colleges

Onderwerpen

€7,49

Krijg toegang tot het volledige document:

Geschreven door studenten die geslaagd zijn

Direct beschikbaar na je betaling

Online lezen of als PDF

Maak kennis met de verkoper

polinastepanova

Maak kennis met de verkoper

polinastepanova Universiteit van Amsterdam

Bekijk profiel

Volgen

Verkocht

Lid sinds

18 uur

Aantal volgers

Documenten

Laatst verkocht

0,0

0 beoordelingen

Recent door jou bekeken

Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via iDeal of creditcard en download je PDF-document meteen.

“Gekocht, gedownload en geslaagd. Zo makkelijk kan het dus zijn.”

Alisha Student

Veelgestelde vragen

Wat krijg ik als ik dit document koop?

Je krijgt een PDF, die direct beschikbaar is na je aankoop. Het gekochte document is altijd, overal en oneindig toegankelijk via je profiel.

Tevredenheidsgarantie: hoe werkt dat?

Onze tevredenheidsgarantie zorgt ervoor dat je altijd een studiedocument vindt dat goed bij je past. Je vult een formulier in en onze klantenservice regelt de rest.

Van wie koop ik deze samenvatting?

Stuvia is een marktplaats, je koop dit document dus niet van ons, maar van verkoper polinastepanova. Stuvia faciliteert de betaling aan de verkoper.

Zit ik meteen vast aan een abonnement?

Nee, je koopt alleen deze samenvatting voor €7,49. Je zit daarna nergens aan vast.

Is Stuvia te vertrouwen?

4,6 sterren op Google & Trustpilot (+1000 reviews) Afgelopen 30 dagen zijn er 49586 samenvattingen verkocht Opgericht in 2010, al 16 jaar dé plek om samenvattingen te kopen

Formula Sheet RL & Deep Learning | Lectures 1-6 | UvA | 2025/26

Voorbeeld van de inhoud

Geschreven voor

Documentinformatie

Onderwerpen

Maak kennis met de verkoper

Recent door jou bekeken

Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Niet tevreden? Kies een ander document

Betaal zoals je wilt, start meteen met leren

Bezig met je bronvermelding?

Veelgestelde vragen

Wat krijg ik als ik dit document koop?

Tevredenheidsgarantie: hoe werkt dat?

Van wie koop ik deze samenvatting?

Zit ik meteen vast aan een abonnement?

Is Stuvia te vertrouwen?