انحراف معیار (Standard Deviation) عددی است که میزان پراکندگی مشاهدات (نسبت به میانگین) را نشان می‌دهد.

انحراف معیار با مستطیل قرمز مشخص شده است

یک تابع ریاضی در هنگام پیش‌بینی مقادیر، اگر داده‌ها بیش از حد پراکنده باشند، با مشکل مواجه خواهد شد. انحراف معیار اندازه‌ای برای میزان عدم قطعیت (در این مورد، یعنی پیش‌بینی) بما می‌دهد. انحراف میانگین کوچک به این معنی است که اکثر داده‌های موجود در دیتاست، نزدیک به مقدار میانگین داده‌های ما هستند. میانگین یک ستون از اعداد برابر است با مجموع تمام انها تقسیم بر تعدادشان. میانگین یک مفهوم بسیار مهم و در عین حال ساده در آمار می‌باشد.

از سوی دیگر، انحراف معیار بزرگ، به این معنی است که مقادیر دیتاست نسبت به میانگین فاصله‌ی بیشتری دارند و با به اصطلاح پراکندگی آنها زیاد است.

نکته: انحراف معیار گاهن با نماد σ (Sigma) نشان داده می‌شود.

می‌توانیم از تابع ()std از نامپای به منظور یافتن انحراف میانگین یک متغیر یا ستون استفاده نمائیم.

مثال:

import numpy as np
std = np.std(full_health_data)
print(std)

خروجی کد فوق برابر است با شکل زیر:

انحراف معیار متغیرها (ستون‌ها)

اعداد فوق چه پیامی برای شما دارند؟ چیزی از آنها می‌فهمید؟

ضریب تغییرات

ضریب تغییرات (Coefficient of Variation) به منظور کسب آگاهی از میزان بزرگی انحراف معیار استفاده می‌شود. بطور ریاضی، این مفهوم بشکل زیر تعریف می‌گردد:

Coefficient of Variation = Standard Deviation / Mean

می‌توانیم این مفهوم را در پایتون و با استفاده از کد زیر پیاده‌سازی کنیم.

مثال:

import numpy as np
cv = np.std(full_health_data) / np.mean(full_health_data)
print(cv)

خروجی اجرای کد فوق به شرح ذیل است:

ضریب تغییرات متغیرها

مشاهده می‌کنیم که متغیرهای Duration, Calorie_Burnage, Hours_Work دارای انحراف معیار بزرگ‌تری نسبت به سه متغیر Max_Pulse, Average_Pulse و Hours_Sleep هستند.