هوش مصنوعی و رباتیکپیشرفته
کلاس آنلاین و کارگاه زنده: یادگیری تقویتی عمیق (Deep RL) در رباتیک
پیادهسازی زنده الگوریتمهای PPO, SAC و شبیهسازی در محیطهای PyBullet و Gymnasium
برنامه جلسات
یکشنبهها و سهشنبهها - ساعت ۱۹:۰۰ الی ۲۱:۰۰
تعداد کل جلسات
16 جلسه (32 ساعت)
ظرفیت پذیرش
19 / 25 نفر
نوع مدرک
گواهی بینالمللی NOA
استاد و مدرس دوره:
مهندس سهراب دلاوری
آزمایشگاه سامانههای خودران NOA
مهندس سهراب دلاوری
سرپرست تیم کنترل هوشمند و یادگیری تقویتی
برنامه و سرفصل تفکیکی جلسات کلاس
شامل مباحث تدریس، تمرینات عملی و وضعیت ویدیوی ضبطشده هر جلسه
1
مبانی ریاضیات RL، فرآیند مارکوف و الگوریتمهای برنامهریزی پویا (DP)
۱۰ آبان ۱۴۰۳•۱۹:۰۰ - ۲۱:۰۰
جلسه آتی
معادله بلمنارزیابی سیاست (Policy Evaluation)بهبود سیاست (Policy Iteration)
2
روشهای بدون مدل: مونت کارلو و یادگیری تفاوت زمانی (TD Learning & Q-Learning)
۱۲ آبان ۱۴۰۳•۱۹:۰۰ - ۲۱:۰۰
جلسه آتی
SARSA vs Q-Learningاکتشاف اپسیلون-حریصانه (Epsilon Greedy)تخمین ارزش توابع
دستاوردها و مهارتهای پس از پایان کلاس
درک دقیق فرآیندهای تصمیمگیری مارکوف (MDP) و معادله بلمن
پیادهسازی شبکههای Deep Q-Networks (DQN) همراه با Double DQN و Dueling
تسلط بر الگوریتمهای پیوسته PPO و Soft Actor-Critic (SAC)
انتقال سیاست یادگرفتهشده از شبیهساز به سیستمهای واقعی (Sim2Real Transfer)
ویژگیهای کلاس تعاملی
- کلاسهای زنده کمجمعیت برای حداکثر بازدهی تعاملی
- کدنویسی زنده صفر تا صد الگوریتمهای Actor-Critic
- پروژه عملی پایانی: آموزش حرکت خودکار ربات چهارپا (Quadruped)
- جلسات هفتگی حل تمرین و بهینهسازی هایپرپارامترها
اتاق کلاس آنلاین تعاملی
محیط اختصاصی یادگیری شامل وایتبرد ریاضی، ادیتور کد پایتون، اجازه صحبت صوتی و دفترچه نوتبرداری زنده.
ورود به محیط کلاس آنلاین