CENG 567

Pekiştirmeli Öğrenme

CENG567 Pekiştirmeli Öğrenme

Bu ders, çok kollu banditler, Q-öğrenme ve derin pekiştirmeli öğrenme gibi temel teknikleri kapsayacak şekilde pekiştirmeli öğrenmeyi tanıtır. Öğrenciler belirsizlik altında karar vermeyi öğrenecek ve aktör-kritik modeller gibi ileri düzey yöntemleri gerçek dünya problemlerine uygulayacaktır.

Dersin Amacı

Bu ders, çok kollu banditler, Q-öğrenme ve derin pekiştirmeli öğrenme gibi temel teknikleri kapsayacak şekilde pekiştirmeli öğrenmeyi tanıtır. Öğrenciler belirsizlik altında karar vermeyi öğrenecek ve aktör-kritik modeller gibi ileri düzey yöntemleri gerçek dünya problemlerine uygulayacaktır.

Dersin İçeriği

Çok kollu banditler, epsilon greedy, üst güven sınırları, thompson örneklemesi, bağlamsal banditler, markov karar süreci, dinamik programlama, politika ve değer iterasyonu, monte carlo yöntemleri, zamansal fark, Q-öğrenme, derin Q-öğrenme, aktör-kritik modeller.

Dersin Koordinatörü

Dr. Öğretim Üyesi Alper Demir

Dersi Verenler

Dr. Öğretim Üyesi Alper Demir

Önerilen veya Gerekli Kaynaklar

Richard S. Sutton, Andrew G. Barto. Reinforcement Learning: An Introduction. Bradford Books, 2nd ed., 2018.

Dersin Öğrenme Çıktıları

  1. Pekiştirmeli öğrenmenin temellerini ve temel kavramlarını anlayabilme.
  2. Q-öğrenme ve derin Q-öğrenme gibi temel algoritmaları uygulayabilme.
  3. Markov karar süreçlerini ve politika optimizasyonunu analiz edebilme.
  4. Pekiştirmeli öğrenme çözümlerini gerçek dünya senaryolarında uygulayabilme.

Haftalık Program

Hafta Konu
1 Giriş (İlgili Okuma: Sutton & Barto Bölüm 1)
2 Çok Kollu Banditler (İlgili Okuma: Sutton & Barto Bölüm 2)
3 Markov Karar Süreçleri (İlgili Okuma: Sutton & Barto Bölüm 3)
4 Dinamik Programlama (İlgili Okuma: Sutton & Barto Bölüm 4)
5 Monte Carlo Yöntemleri (İlgili Okuma: Sutton & Barto Bölüm 5)
6 Zamansal Fark Öğrenmesi (İlgili Okuma: Sutton & Barto Bölüm 6)
7 n-Adımlı Önyükleme (İlgili Okuma: Sutton & Barto Bölüm 7)
8 Tablosal Yöntemlerle Planlama ve Öğrenme (İlgili Okuma: Sutton & Barto Bölüm 8)
9 Değer Fonksiyonu Yaklaşımı ve Uygunluk İzleri (İlgili Okuma: Sutton & Barto Bölüm 9, 12)
10 Politika Gradyanı Yöntemleri ve Aktör-Kritik (İlgili Okuma: Sutton & Barto Bölüm 13 + Makaleler)
11 Derin Pekiştirmeli Öğrenme Yöntemleri (İlgili Okuma: Seçilmiş Makaleler)
12 İleri Düzey Konular (İlgili Okuma: Seçilmiş Makaleler)
13 İleri Düzey Konular (İlgili Okuma: Seçilmiş Makaleler)
14 Makale Sunumları

Değerlendirme

3 Ödev: %24

Ara Sınav: %25

Final: %35

Makale Sunumu: %16