دوره

یادگیری تقویتی با Gymnasium در پایتون

سفر یادگیری تقویتی خودتون رو شروع کنید! یاد بگیرید چطور اِیجنت‌ها می‌تونن از طریق تعامل با محیط، مسائل رو حل کنن.

مقدماتی
تاریخ به‌روزرسانی:
17 شهریور 1405
پایتون
۴ ساعت
۱۵ ویدیو
۳۷ تمرین
۵۰۱ شرکت‌کننده
۴۴۰
کاربرهای فینکا در چه شرکت‌هایی مشغول به کار هستند؟
توضیحات دوره
سفر هیجان‌انگیزتون رو در دنیای یادگیری تقویتی، که یکی از شاخه‌های کلیدی یادگیری ماشینه، شروع کنید. این دوره تعاملی شما رو به یک سفر جامع در اصول پایه‌ای یادگیری تقویتی می‌بره؛ جایی که هنر آموزش اِیجنت‌ها هوشمند رو یاد می‌گیرید و بهشون یاد می‌دید چطور تصمیم‌های استراتژیک بگیرن و پاداش‌ها رو به حداکثر برسونن. اِیجنت‌ها شما یاد می‌گیرن که چطور در محیط‌های مختلف ابزار Gymnasium متعلق به OpenAI حرکت کنن، از جمله عبور از دریاچه‌های یخ‌زده و کوه‌ها.

همونیه که می‌خواید یاد بگیرید؟

1
مقدمه‌ای بر یادگیری تقویتی

وارد دنیای هیجان‌انگیز یادگیری تقویتی می‌شید و با مفاهیم پایه، نقش‌ها و کاربردهای اون آشنا می‌شید. چارچوب یادگیری تقویتی و نحوه تعامل عامل با محیط رو بررسی می‌کنید. همچنین یاد می‌گیرید چطور با استفاده از کتابخونه Gymnasium کار کنید، وضعیت‌ها رو مصورسازی کنید و اقداماتی انجام بدید تا پایه‌ای عملی برای کار با مفاهیم و کاربردهای یادگیری تقویتی به دست بیارید.

2
یادگیری مبتنی بر مدل

عمیق‌تر وارد دنیای یادگیری تقویتی می‌شید و این بار روی یادگیری مبتنی بر مدل تمرکز می‌کنید. با فرایندهای تصمیم‌گیری مارکوف و اجزای اصلی اون‌ها آشنا می‌شید. همچنین درباره سیاست‌ها و توابع ارزش یاد می‌گیرید و با تکنیک‌های تکرار سیاست و تکرار ارزش، مهارت‌تون رو در بهینه‌سازی سیاست‌ها تقویت می‌کنید.

3
یادگیری بدون مدل

وارد دنیای یادگیری بدون مدل در یادگیری تقویتی می‌شید. ابتدا با روش‌های پایه مونت‌کارلو آشنا می‌شید و الگوریتم‌های پیش‌بینی مونت‌کارلو با اولین بازدید و همه بازدیدها رو به کار می‌برید. بعد سراغ یادگیری تفاضل زمانی می‌رید و الگوریتم SARSA رو بررسی می‌کنید. در نهایت، با Q-Learning آشنا می‌شید و همگرایی اون رو در محیط‌های چالش‌برانگیز تحلیل می‌کنید.

4
استراتژی‌های پیشرفته در یادگیری تقویتی بدون مدل

با استراتژی‌های پیشرفته‌تر یادگیری تقویتی بدون مدل آشنا می‌شید و روی بهبود الگوریتم‌های تصمیم‌گیری تمرکز می‌کنید. Expected SARSA رو برای به‌روزرسانی دقیق‌تر سیاست‌ها و Double Q-Learning رو برای کاهش بایاس بیش‌برآورد یاد می‌گیرید. همچنین توازن اکتشاف-بهره‌برداری رو بررسی می‌کنید و با استراتژی‌های epsilon-greedy و epsilon-decay برای انتخاب بهتر عمل‌ها آشنا می‌شید. در نهایت، سراغ مسئله راهزن چنددسته‌ای می‌رید و روش‌هایی رو برای حل مسائل تصمیم‌گیری در شرایط عدم قطعیت به کار می‌برید.

گواهی پایان دوره

  • تأیید مهارت شما

    با تکمیل این دوره، شما یک گواهی معتبر دریافت می‌کنید که بیانگر کسب مهارت‌های لازم مرتبط با این دوره آموزشی است.

  • اعتبار و اصالت گواهی

    هر مدرک دارای شناسه یکتا و لینک اعتبارسنجی است که امکان بررسی و تأیید اصالت آن را فراهم می‌کند.

  • اشتراک‌گذاری

    می‌توانید گواهی‌های خود را به‌راحتی در شبکه‌های حرفه‌ای مانند لینکدین با دیگران به اشتراک بگذارید.

اشتراک‌گذاری

سوالات متداول

باید با مفاهیم پایه احتمال و آمار آشنا باشید. همچنین آشنایی با NumPy، Pandas و Scikit-learn که در دوره‌های پیش‌نیاز آموزش داده می‌شن، لازمه.

در طول دوره، پیمایش سیاست، پیمایش مقدار، روش‌های مونت‌کارلو با اولین بازدید و همه بازدیدها و SARSA و یادگیری Q و Expected SARSA و یادگیری Q دوگانه رو پیاده‌سازی می‌کنید.

اِیجنت‌ها رو آموزش می‌دید تا در محیط‌هایی مثل دریاچه یخ‌زده و سناریوی ماشین کوهستانی از مجموعه Gymnasium حرکت کنن و در کنار اون، یاد می‌گیرید وضعیت‌ها رو مصورسازی کنید و اقدام‌های مختلف رو انجام بدید.

در یادگیری مبتنی بر مدل، از فرایندهای تصمیم‌گیری مارکوف با احتمال‌های انتقال مشخص استفاده می‌شه. اما در روش‌های بدون مدل مثل مونت‌کارلو و یادگیری Q، مدل مستقیما از تجربه یاد می‌گیره و نیازی به مدل محیط نداره.

بله. در بخش پایانی، با استراتژی‌های اپسیلون حریصانه و اپسیلون حریصانه کاهشی برای ایجاد تعادل بین اکتشاف و بهره‌برداری آشنا می‌شید و از اون‌ها برای حل مسئله راهزن چند دست استفاده می‌کنید.

دریافت اپلیکیشن فینکا

با اپلیکیشن فینکا، به بیشتر دوره‌ها و مسیرها روی موبایل دسترسی دارید، تمرین می‌کنید و یادگیری رو هم‌زمان روی موبایل و دسکتاپ ادامه می‌دید.