تکنیکهای طبقهبندی (Classification) بخش مهمی از کاربردهای یادگیری ماشین و دادهکاوی رو تشکیل میدن. تقریبا ۷۰٪ از مسائل علم داده به طبقهبندی مربوط میشه. مسائل طبقهبندی متنوعی وجود داره، اما رگرسیون لجستیک (Logistic regression) یه روش رایج و کاربردی برای حل مسائل طبقهبندی باینری یا دوکلاسه (Binary classification) به حساب مییاد. یه دسته دیگه، طبقهبندی چندکلاسهست (Multinomial classification) که با مسائلی سروکار داره که در اونها متغیر هدف چند تا کلاس داره. مثلا مجموعه داده IRIS یه نمونه خیلی معروف از طبقهبندی چندکلاسهست. دستهبندی مقالات، بلاگها و اسناد هم مثالهای دیگهای از این نوع هستن.
از رگرسیون لجستیک میشه برای مسائل طبقهبندی مختلفی مثل تشخیص اسپم استفاده کرد. پیشبینی دیابت، اینکه آیا یه مشتری محصول خاصی رو میخره یا نه، اینکه مشتری ریزش میکنه یا نه، یا اینکه کاربر روی یه لینک تبلیغاتی کلیک میکنه یا نه، همگی مثالهای دیگهای از این دست هستن.
رگرسیون لجستیک یکی از سادهترین و پرکاربردترین الگوریتمهای یادگیری ماشین برای طبقهبندی دوکلاسهست. پیادهسازیش راحته و میتونه به عنوان یه مدل پایه (Baseline) برای هر مسئله طبقهبندی باینری استفاده بشه. مفاهیم پایهای این الگوریتم در یادگیری عمیق هم خیلی به درد میخوره. رگرسیون لجستیک در واقع رابطه بین یه متغیر وابسته باینری و متغیرهای مستقل رو توصیف و تخمین میزنه.
برای تمرین بیشتر روی رگرسیون لجستیک، حتما تمرینهای دوره مدلسازی ریسک اعتباری در R ما در فینکا رو بررسی کن که پر از مثالهای دنیای واقعیه.


