واریانس عدد (یا معیار) دیگری است که مشابه با انحراف معیار، نشان دهنده‌ی میزان پراکندگی داده‌ها (نسبت به میانگین) است. در حقیقت، اگر جذر (رساندن عدد به توان 2) انحراف معیار را حساب کنیم، به واریانس خواهیم رسید (همچنین اگر از واریانس ریشه‌ی دوم بگیریم به انحراف معیار خواهیم رسید). ابتدا از دیتاست سلامت با 10 مشاهده استفاده می‌کنیم تا با نحوه‌ی بدست آوردن واریانس آشنا شویم.

دیتاست سلامت با 10 مشاهده

نکته: واریانس اغلب با نماد σ^2 (Sigma Square) نشان داده می‌شود.

مرحله‌ی اول در محاسبه‌ی واریانس: یافتن میانگین

در ادامه قصد داریم واریانس متغیر Average_Pulse یا همان متوسط ضربان قلب را بیابیم.

1- یافتن میانگین: میانگین با جمع کردن تمام اعداد ستون تقسیم بر تعداد آنها بدست می‌آید. پس داریم

(80+85+90+95+100+105+110+115+120+125) / 10 = 102.5

عبارت فوق به این معنی است که میانگین متغیر متوسط ضربان قلب برابر است با 102.5.

مرحله‌‌ی دوم: برای هر مقدار تفاضل آن عدد از میانگین را می‌یابیم

2- تفاضل مقادیر مختلف از ستون متوسط ضربان قلب را نسبت به میانگین پیدا می‌کنیم. در واقع داریم:

80 – 102.5 = -22.5
85 – 102.5 = -17.5
90 – 102.5 = -12.5
95 – 102.5 = -7.5
100 – 102.5 = -2.5
105 – 102.5 = 2.5
110 – 102.5 = 7.5
115 – 102.5 = 12.5
120 – 102.5 = 17.5
125 – 102.5 = 22.5

مرحله‌ی سوم: برای هر تفاضل بدست آمده، جذر را می‌یابیم

3- جذر یا توان دوم هر کدام از تفاضل‌های بدست آمده در بالا را محاسبه می‌کنیم. پس داریم:

(-22.5)^2 = 506.25
(-17.5)^2 = 306.25
(-12.5)^2 = 156.25
(-7.5)^2 = 56.25
(-2.5)^2 = 6.25
2.5^2 = 6.25
7.5^2 = 56.25
12.5^2 = 156.25
17.5^2 = 306.25
22.5^2 = 506.25

مرحله‌ی چهارم: واریانس، میانگین اعداد مجذور شده در بالاست

4- مقادیر مجذور شده در بالا را با یکدیگر جمع کرده و سپس عدد حاصل را بر تعداد کل تقسیم می‌کنیم. داریم:

(506.25 + 306.25 + 156.25 + 56.25 + 6.25 + 6.25 + 56.25 + 156.25 + 306.25 + 506.25) / 10 = 206.25

بنابراین واریانس ستون متوسط ضربان قلب برابر است با 206.5.

استفاده از پایتون برای یافتن واریانس دیتاست سلامت

می‌توانیم از تابع ()var از نامپای به منظور یافتن واریانس تمام ستون‌های دیتاست سلامت استفاده نمائیم (توجه کنید که دیتاست health_data تنها دارای 10 مشاهده است).

مثال:

import numpy as np
var = np.var(health_data)
print(var)

خروجی کد فوق به شکل زیر است:

واریانس متغیرهای دیتاست سلامت

می‌توانیم از کد فوق برای محاسبه‌ی واریانس دیتاست اصلی یعنی full_health_data نیز استفاده کنیم.

مثال:

import numpy as np
var_full = np.var(full_health_data)
print(var_full)

 

خروجی کد فوق بشرح ذیل است:

واریانس ستون‌های دیتاست کامل سلامت