Ortalama ve Medyan
Tüm istatistikteki en çok kullanılan iki özet, birer fonksiyon çağrısıdır:
mean() her şeyi toplar ve sayıya böler. median() değerleri sıralar ve ortadakini seçer (sayı çiftse ortadaki ikisinin ortalamasını alır). mtcars içindeki 32 araba için ortalama yakıt ekonomisi yaklaşık 20.1 mpg, medyan ise 19.2'dir - birbirine yakın; bu da verinin kötü biçimde çarpık olmadığını söyler. Birbirlerinden çok ayrıldıklarında bu da bir bilgidir; sona doğru ona geleceğiz.
Herkesi şaşırtan bir şey: vektör tek bir NA bile içeriyorsa iki fonksiyon da NA döndürür:
Bu bilinçlidir - R, eksik değer yokmuş gibi davranmayı sessizce reddeder. na.rm = TRUE, "elindeki değerler üzerinde hesapla" der. Bu yazıdaki neredeyse her özet fonksiyonu bunu kabul eder. NA'nın nasıl yayıldığının tam hikâyesi eksik değerler sayfasındadır.
Standart Sapma ve Varyans
sd() yayılımı ölçer: kabaca, tipik bir değerin ortalamadan ne kadar uzakta durduğunu, verinin kendi biriminde. var() onun karesidir:
Yaklaşık 6 mpg'lik bir standart sapma, arabaların tipik olarak 20.1 ortalamasının kabaca 6 mpg içinde durduğu anlamına gelir. sd() verinin kendi biriminde olduğu için raporlayacağınız odur; var() çoğunlukla başka formüllerin içinde görünür.
Ders çalışması için önem taşıyan ayrıntı şudur: sd() ve var() örneklem istatistiğini hesaplar - toplanan kare sapmaları n yerine n − 1'e bölerler:
Neden n − 1? Çünkü ortalamayı aynı veriden tahmin ettiniz; o tahmini ortalama etrafındaki sapmalar sistematik olarak biraz fazla küçüktür ve n − 1'e bölmek bunu düzeltir. Veriniz neredeyse her zaman daha büyük bir şeyden alınmış bir örneklem olduğu için n − 1 sürümü istediğinizdir. Gerçekten tüm evrene sahipseniz (sınıftaki her öğrenci, katalogdaki her ürün), çarpın: var(x) * (n - 1) / n.
Ortalamanın Standart Hatası
Standart sapma ve standart hata sürekli karıştırılır, o yüzden onları ayrı tutun: sd veriyi betimler, SE ortalamaya dair tahmininizi betimler. R'de yerleşik bir se() yoktur, ama formül tek satırdır:
Standart hata örneklem büyüdükçe küçülür - dört kat veri toplayın, SE yarıya iner - çünkü daha büyük bir örneklem ortalamayı daha hassas sabitler. sd örneklem büyüklüğüyle küçülmez; kaç tanesini ölçerseniz ölçün arabalar ne kadar çeşitliyse o kadar çeşitlidir. SE, ekmeğini çıkardığı yer olan güven aralıklarının yapı taşıdır.
summary() - Tek Çağrılık Genel Bakış
summary() size beş sayılı özeti artı ortalamayı tek seferde verir ve bütün veri çerçevelerinde çalışır:
Bir veri çerçevesi üzerinde çağrıldığında her sütunu özetler - sayısal sütunlar min/çeyreklikler/ortalama/maks alır ve faktörler seviye başına sayım alır. Yeni yüklediğiniz her veri kümesinde çalıştırılacak ilk şeydir: imkânsız değerler (negatif bir yaş, 9999 olan bir maksimum) anında göze çarpar.
Çeyreklikler, Aralık ve IQR
quantile(), medyanı herhangi bir kesme noktasına genelleştirir:
Argümansız çağrıldığında minimumu, çeyrekleri ve maksimumu döndürür. Belirli kesme noktaları için probs = geçirin - yukarıdaki 10. ve 90. yüzdelikler verinin büyük kısmının yaşadığı yeri parantez içine alır. IQR() (25. ve 75. yüzdelikler arasındaki mesafe), sd() fonksiyonunun aksine aykırı değerler tarafından oradan oraya sürüklenmeyen bir yayılım ölçüsüdür. range() min ve maksı bir çift olarak döndürür.
Mod: R'nin mode() Fonksiyonu Bunu YAPMAZ
Bu, herkesi tam olarak bir kez yakalar. R'de mode() adında bir fonksiyon vardır ve istatistikle hiçbir ilgisi yoktur - bir nesnenin saklama türünü bildirir:
Hatırlanacak deyim: table(x) her değerin ne sıklıkta göründüğünü sayar, which.max() en büyük sayımı bulur ve names() değerin kendisini çıkarır. Sonucun bir character metin olarak geri geldiğine dikkat edin (tablo isimleri her zaman öyledir); onunla hesap yapmanız gerekiyorsa as.numeric() içine sarın. İki değer eşitse which.max() sessizce yalnızca ilkini döndürür - eşitlik olası olduğunda tabloyu kendiniz kontrol edin.
Ortalama mı Medyan mı: Hangisi Raporlanmalı
Ortalama her değeri kullanır; bu hem gücü hem zayıflığıdır - tek bir uç değer onu sürükler. Medyan yalnızca ortayı önemser, dolayısıyla aykırı değerler ona neredeyse dokunmaz:
Eklenen tek bir değer ortalamayı yaklaşık 49.300'den 155.000'in üzerine iter - verideki hiç kimseyi betimlemeyen bir sayı - medyan ise yalnızca 48.000'den 49.500'e hareket eder. Gelir, ev fiyatları ve hastanede kalış sürelerinin medyan olarak raporlanmasının nedeni budur: uzun kuyruklu çarpık veri, ortalamayı yanıltıcı kılar. Kabaca simetrik veride ikisi uyuşur ve ortalama gayet iyidir (ve istatistiksel olarak daha verimlidir). Hızlı bir histogram hangi durumda olduğunuzu söyler - ve ortalamanızı medyanınızla karşılaştırmak zaten tek satırlık bir çarpıklık kontrolüdür.
Buradan Ne Çıkarıyorsunuz
mean(x)vemedian(x)- eksik değerler olduğundana.rm = TRUEekleyin.sd(x)vevar(x)örneklem istatistiğini hesaplar (n − 1paydası) - ki istediğiniz budur.- Standart hata
sd(x) / sqrt(length(x))'tir - verinin ne kadar yayıldığını değil, ortalamayı ne kadar iyi bildiğinizi ölçer. - Yeni bir veri çerçevesinde
summary(), R'deki en hızlı sağlama kontrolüdür. - Mod
names(which.max(table(x)))'tir - R'ninmode()fonksiyonu saklama türleriyle ilgilidir. - Çarpık veri ya da aykırı değerler: medyanı raporlayın. Simetrik veri: ortalama gayet iyi.
Sırada: iki değişkenin birlikte nasıl hareket ettiğini ölçmek - cor() ve cor.test() ile korelasyon.
Sıkça Sorulan Sorular
R'de standart sapma nasıl hesaplanır?
sd(x) ile. Bunun örneklem standart sapmasını hesapladığına dikkat edin - n yerine n − 1'e böler. Neredeyse her gerçek analizde istediğiniz budur, çünkü veriniz neredeyse her zaman tüm evren değil bir örneklemdir.
R'de ortalama ve medyan nasıl bulunur?
mean(x) ve median(x). Vektör eksik değerler içeriyorsa ikisi de NA döndürür - mevcut değerler üzerinde hesaplamak için na.rm = TRUE ekleyin: mean(x, na.rm = TRUE).
R'de mod nasıl bulunur?
mode() ile değil - o fonksiyon en sık geçen değeri değil, bir nesnenin saklama türünü döndürür. Bunun yerine tablo deyimini kullanın: names(which.max(table(x))), en sık görünen değeri döndürür.
R'de standart hata nedir?
Yerleşik bir fonksiyon yoktur. Onu sd(x) / sqrt(length(x)) olarak hesaplayın. Standart sapma verinizin yayılımını betimler; standart hata ise ortalamayı ne kadar hassas tahmin ettiğinizi betimler ve örneklem büyüdükçe küçülür.