ما الذي تعنيه "ثقة 95%" فعلًا
تحوّل فترة الثقة تقديرًا نقطيًا ("متوسط العينة 5.61") إلى مدى صادق ("من المعقول أن يقع المتوسط الحقيقي بين 5.29 و5.93"). لكن عبارة ثقة 95% من أكثر العبارات إساءةً للفهم في الإحصاء، فلنضبطها منذ البداية.
فالنسبة 95% تصف الإجراء لا الفترة. تخيّل أنك تعيد دراستك مرارًا وتكرارًا، بعينة جديدة وفترة جديدة في كل مرة. ستقفز الفترات هنا وهناك، وسيلتقط نحو 95% منها القيمة الحقيقية بينما يخطئها 5%. وفترتك الفعلية الواحدة سحبة واحدة من تلك العملية. وما لا تعنيه النسبة 95%: "ثمة احتمال 95% بأن المتوسط الحقيقي داخل هذه الأرقام". فالمتوسط الحقيقي عدد ثابت (مجهول) ولا يتجول داخل الفترات وخارجها، بل الفترات هي المتغيرة.
وعمليًا لا بأس بالقراءة الودودة: فالفترة هي مدى القيم المتوافقة مع بياناتك. فقط اعرف أي ادعاء يحق لك تقديمه حين يضغط عليك أحدهم.
فترة ثقة للمتوسط بالطريقة السهلة
كل استدعاء لـ t.test() يحمل فترة ثقة، ويمكنك إجراء الاختبار لمجرد حصاد الفترة:
المتوسط 5.61، وفترة الثقة 95% من نحو 5.29 إلى 5.93. وتؤدي الفترة ما لا يستطيع المتوسط المجرد أداءه: فهي تُظهر مقدار الدقة الذي تشتريه لك عشر ملاحظات فعلًا.
الفترة نفسها يدويًا
الصيغة الكامنة خلف تلك الفترة تستحق البناء مرة واحدة، لأنها تزيل الغموض عن كل فترة ثقة ستقرأها: التقدير ± القيمة الحرجة × الخطأ المعياري.
طابقها مع مخرجات t.test() فستجد الفترة نفسها حتى آخر رقم. وثمة ثلاثة أجزاء متحركة:
- الخطأ المعياري
sd(x)/sqrt(n)يقيس مقدار تذبذب متوسط العينة (راجع الإحصاءات الوصفية للفرق بين الانحراف المعياري والخطأ المعياري). qt(0.975, df)هي القيمة الحرجة لتوزيع t: فلتغطية 95% تترك 2.5% في كل ذيل، ومن هنا القيمة 0.975. وعند df = 9 تبلغ نحو 2.26، وهي أكبر من قيمة التوزيع الطبيعي 1.96، وتلك ضريبة العينة الصغيرة مقابل تقدير الانحراف المعياري من البيانات نفسها.- هامش الخطأ هو حاصل ضربهما، وهو رقم "±" الذي تتصدر به العناوين.
تغيير المستوى: 90% و99% والمقايضة
يتحكم conf.level في التغطية، ومعها في الاتساع:
الثقة الأعلى تكلّف اتساعًا أكبر، فالفترة 99% يجب أن تتسع بما يكفي لتصيب 99 مرة من كل 100، ولذا تتمدد، بينما الفترة 90% أضيق لكنها تخطئ ضعف ما تخطئه الفترة 95%. فلا وجبة مجانية هنا، بل قرص ضبط فقط. والنسبة 95% محض عرف، أي قيمة افتراضية تستحق الإبقاء ما لم يكن لديك سبب، لا قانونًا من قوانين الطبيعة.
فترة ثقة للنسبة: prop.test()
افترض أن 47 من أصل 120 مستخدمًا شملهم الاستبيان تبنّوا ميزة جديدة. فما المدى المعقول لمعدل التبني الحقيقي؟
نسبة العينة 0.39، وفترة الثقة 95% من نحو 0.30 إلى 0.49، فعبارة "نحو 40% تبنّيًا" لا تكون صادقة إلا بإلحاق هالة ±9 نقاط بها. وتستخدم prop.test() تقريبًا أفضل من صيغة الكتب المدرسية p ± 1.96 × sqrt(p(1−p)/n) (فهي فترة من نمط ويلسون مع تصحيح الاتصال)، وهو ما يهم أكثر قرب 0 أو 1، إذ قد تخرج فترة الكتب المدرسية عن المجال [0, 1] بينما لا تستطيع هذه ذلك. وللأعداد الصغيرة جدًا تعطي binom.test(47, 120)$conf.int النسخة المضبوطة.
فترات ثقة لمعاملات النماذج: confint()
تحصل النماذج المعايرة على فترات عبر دالة عامة واحدة:
يحصر كل صف معاملًا واحدًا من الانحدار الخطي: فتمتد فترة الثقة 95% لميل wt من نحو −6.5 إلى −4.2 ميل لكل غالون لكل 1000 رطل. وهذا أكثر إفادة من قيمة p في الملخص، إذ يقول إن الأثر ليس غير صفري فحسب بل لا يقل عن نحو 4 أميال لكل غالون وقد يبلغ نحو 6.5.
وبالنسبة إلى نموذج glm() لوجستي، تعمل confint(fit) بالطريقة نفسها لكنها تُرجع حدودًا باللوغاريتم الأرجحي، فارفعها أسّيًا للحصول على فترات نسب الأرجحية عبر exp(confint(fit))، وتذكّر أن القيمة المرجعية لـ "لا أثر" تصبح 1 بدل 0.
حجم العينة: قانون الجذر التربيعي
يتقلص الاتساع مع sqrt(n)، ولهذا نتيجة يسهل تذكرها: ضاعِف البيانات أربع مرات تنكمش الفترة إلى النصف. وراقب ذلك يحدث ببيانات محاكاة، بالتوزيع نفسه وعينة أكبر أربع مرات (والبذرة تجعل المثال قابلًا للتكرار، راجع الأعداد العشوائية):
ويقترب الاتساعان من نسبة 2:1 (وضوضاء المعاينة تمنعها من أن تكون مضبوطة). والجذر التربيعي هو سبب غلاء الدقة: فالملاحظات المئة الأولى تشتري لك تضييقًا أكبر مما تشتريه الملاحظات الثلاثمئة التالية مجتمعة، وتنصيف فترة ضيقة أصلًا يكلّف دائمًا أربعة أضعاف ما دفعته حتى تلك اللحظة.
فترة الثقة وقيمة p: منظوران لاختبار واحد
فترة الثقة واختبار الفرضية هما المعلومة نفسها بثوبين مختلفين. فالفترة 95% تحتوي بالضبط على قيم المعلمة التي لن يرفضها اختبار ثنائي الجانب عند مستوى 0.05. ومن ثم:
- استبعاد فترة الثقة لفرق المتوسطات للقيمة 0 يكافئ أن يقول اختبار t إن p < 0.05.
- استبعاد فترة الثقة لنسبة الأرجحية للقيمة 1 يكافئ أن تكون قيمة p للمعامل أقل من 0.05.
وحين تملك الفترة فأنت تملك عادةً الملخص الأفضل: فهي تعطي حكم المعنوية نفسه إضافة إلى حجم الأثر بوحدات حقيقية. فعبارة "p = 0.03" تقول إن ثمة فرقًا، وعبارة "فترة الثقة 95%: من 0.2 إلى 7.6" تقول إنه موجود وقد يكون تافهًا وقد يكون هائلًا، وهذا غالبًا هو الاكتشاف المهم.
الخلاصة
- تصف النسبة 95% معدل إصابة الإجراء على المدى الطويل، لا احتمال أن تكون هذه الفترة بعينها التقطت الحقيقة.
- للمتوسط:
t.test(x)$conf.int، أو يدويًا بالصيغة المتوسط ±qt(0.975, n−1)× الخطأ المعياري. - للنسبة:
prop.test(x, n)$conf.int، ولمعاملات النماذج: confint(fit)(مع الرفع الأسّي لنسب الأرجحية في glm). - الثقة الأعلى تعني فترة أوسع، والنسبة 95% عرف لا قانون.
- يتقلص الاتساع مع sqrt(n): فأربعة أضعاف البيانات تنصّف الفترة.
- تحتوي فترة الثقة على كل قيمة لن يرفضها اختبار عند مستوى 0.05، وخلافًا لقيمة p فإنها تُظهر حجم الأثر.
في المستند التالي: صندوق أدوات المحاكاة الكامن خلف كل ذلك، أي الأعداد العشوائية عبر rnorm وrunif وsample وset.seed.
الأسئلة الشائعة
كيف تحسب فترة ثقة 95% في R؟
للمتوسط، أسرع طريق هو t.test(x)$conf.int. وللنسبة، prop.test(successes, trials)$conf.int. ولمعاملات نموذج lm() أو glm() معاير، confint(fit). وتعتمد الثلاث جميعًا مستوى 95% افتراضيًا، وتغيّره عبر conf.level = 0.90 (أو 0.99).
ما الذي تعنيه فترة الثقة 95% فعلًا؟
هي عبارة عن الإجراء: فلو كررت الدراسة مرات كثيرة وبنيت فترة في كل مرة، لاحتوى نحو 95% من تلك الفترات على القيمة الحقيقية. وهي ليست "احتمال 95% بأن المعلمة داخل هذه الفترة بعينها"، فالمعلمة عدد ثابت، وأي فترة مفردة إما أنها التقطته أو لم تلتقطه.
كيف تحسب فترة ثقة يدويًا في R؟
المتوسط ± القيمة الحرجة × الخطأ المعياري. فللمتوسط: m <- mean(x); se <- sd(x)/sqrt(length(x)); m + c(-1, 1) * qt(0.975, df = length(x) - 1) * se. والاستدعاء qt(0.975, df) هو القيمة الحرجة لتوزيع t التي تترك 2.5% في كل ذيل.
كيف يؤثر حجم العينة في فترة الثقة؟
يتقلص الاتساع مع الجذر التربيعي لـ n: فضاعِف العينة أربع مرات تنكمش الفترة إلى النصف. وذلك الجذر التربيعي هو سبب غلاء آخر قدر من الدقة، فالانتقال من ±2 إلى ±1 يكلّف أربعة أضعاف البيانات لا ضعفين.