केंद्रीय सीमा प्रमेय कैलकुलेटर
नतीजा
मानक त्रुटि
- नमूना माध्यों का माध्य
- 100.0000
- नमूना माध्यों का प्रसरण
- 6.2500
केंद्रीय सीमा प्रमेय कैलकुलेटर यह बताता है कि किसी नमूने के माध्य का नमूनाकरण बंटन कहाँ केंद्रित होता है, कितना फैला होता है, और नमूने का आकार बदलने पर ये दोनों कैसे बदलते हैं। केंद्र यहाँ चौंकाने वाला हिस्सा है — हर नमूना माध्य का औसत किसी भी नमूने के आकार पर समष्टि के माध्य के बराबर ही रहता है, इसलिए ज़्यादा आँकड़े जुटाने से वह हिलता नहीं। जो बदलता है वह चौड़ाई है: मानक त्रुटि समष्टि का मानक विचलन ÷ √n होती है, इसलिए नमूना चार गुना करने पर वह आधी रह जाती है, जबकि प्रसरण चार गुना घट जाता है। प्रमेय का अपना दावा — कि n बढ़ने पर आकृति सामान्य के क़रीब पहुँचती है — आकृति का सवाल है, चौड़ाई का नहीं, और इस पेज का कोई भी हिसाब उसे दिखा नहीं सकता।
नमूना बढ़ने पर मानक त्रुटि कैसे घटती है
| नमूने का आकार, n | √n | मानक त्रुटि ÷ σ |
|---|---|---|
| 1 | 1 | 1 |
| 4 | 2 | 0.5 |
| 16 | 4 | 0.25 |
| 25 | 5 | 0.2 |
| 100 | 10 | 0.1 |
| 400 | 20 | 0.05 |
| 2500 | 50 | 0.02 |
| 10000 | 100 | 0.01 |
तीसरा स्तंभ वह गुणक है जिससे σ को गुणा करना है — 15 का समष्टि मानक विचलन और 100 का नमूना मिलकर 0.1 × 15 = 1.5 की मानक त्रुटि देते हैं। तालिका में कुछ भी आपके माध्य या आपके मानक विचलन पर निर्भर नहीं है, इसीलिए यह ऊपर के पैनल का खंडन नहीं कर सकती: यह फ़ंक्शन 1/√n है, और पैनल उसी फ़ंक्शन को एक बिंदु पर आँकता है। पंक्तियों को नीचे पढ़ते जाइए और वर्गमूल का नियम किसी दावे की तरह नहीं, एक पैटर्न की तरह दिखने लगता है — जिस-जिस बार नमूने का आकार चार गुना होता है, मानक त्रुटि आधी रह जाती है, और आठ पंक्तियाँ चार-चार के अंतराल पर इसलिए चुनी गई हैं कि पैटर्न दोहराए, खिसके नहीं। नमूना आकार वही हैं जिनके वर्गमूल पूर्ण संख्याएँ हैं, इसलिए हर पंक्ति हाथ से जाँची जा सकती है।
फ़ॉर्मूला
E[X̄] = μ Var(X̄) = σ² / n SE = σ / √n
- μ
- समष्टि का माध्य — उस बंटन का केंद्र जिससे नमूने निकाले जाते हैं। यह नमूनाकरण बंटन के माध्य के रूप में बिना बदले वापस आता है, जो तीन नतीजों में पहला है और हर नमूने के आकार पर सच रहता है
- σ
- समष्टि का मानक विचलन। इसकी इकाई वही है जो आँकड़ों की है, और मानक त्रुटि की इकाई भी वही, इसीलिए σ और SE की सीधे तुलना की जा सकती है — 15 के σ के बग़ल में 2.5 की मानक त्रुटि आँकड़ों के बारे में नहीं, नमूने के आकार के बारे में बताती है
- n
- एक नमूने में कितने मान हैं — हर बार निकाले गए नमूने का आकार, नमूने कितनी बार निकाले गए यह नहीं। यह एक जगह √n के रूप में आता है और दूसरी जगह n के रूप में, और यही फ़र्क़ पूरा व्यावहारिक संदेश है: प्रसरण n के अनुपात में घटता है, मानक त्रुटि सिर्फ़ उसके वर्गमूल के अनुपात में
- X̄
- नमूना माध्य, जिसे किसी एक संख्या के बजाय एक यादृच्छिक राशि की तरह देखा जाता है। एक नमूना एक X̄ देता है; नमूना लेना दोहराने पर इनका एक बंटन बनता है, और तीनों नतीजे किसी एक नमूने के बजाय उसी बंटन का वर्णन करते हैं
- SE
- मानक त्रुटि — नमूना माध्यों का मानक विचलन, और इस पेज का मुख्य नतीजा। विश्वास अंतराल इसी से बनता है और परीक्षण सांख्यिकी इसी से भाग देती है, इसीलिए पढ़ने लायक संख्या यही है, वह प्रसरण नहीं जिसका यह वर्गमूल है
इसे तब इस्तेमाल कीजिए जब यह जानना हो कि कोई नमूना माध्य एक नमूने से दूसरे नमूने तक कितना खिसक सकता है — अध्ययन की योजना बनाते समय, किसी रिपोर्ट में छपी मानक त्रुटि पढ़कर यह देखते समय कि वह आई कहाँ से, या यह जाँचते समय कि नमूने का आकार बढ़ाने के बारे में आपका अंतर्ज्ञान सही है या नहीं। जिस अंतर्ज्ञान को यह ठीक करता है वह आम तौर पर यह होता है कि बड़ा नमूना अनुपात में बेहतर अनुमान देता है: ऐसा नहीं है, क्योंकि मानक त्रुटि वर्गमूल के अनुपात में घटती है। 100 मानों से 400 पर जाने पर अनुमान का फैलाव आधा हो जाता है, और एक और आधा करने की क़ीमत 1600 है। ऊपर के दोनों नतीजे किसी भी आकृति की समष्टि पर लागू होते हैं, इसीलिए बंटन के बारे में कुछ भी जानने से पहले भी इन्हें इस्तेमाल किया जा सकता है। जो बात यह पेज नहीं बता सकता वह यह है कि कोई दिया हुआ n नमूना माध्य के लगभग सामान्य होने के लिए काफ़ी बड़ा है या नहीं — वह इस पर निर्भर है कि नीचे का बंटन कितना तिरछा है, और वह गणना नहीं, एक निर्णय है।
हल किए हुए उदाहरण
डिफ़ॉल्ट: माध्य 100 और मानक विचलन 15 वाली समष्टि, एक बार में 36 का नमूना
- नमूना माध्यों का प्रसरण: σ² / n = 225 / 36 = 6.25
- मानक त्रुटि: √6.25 = 2.5
- नमूना माध्यों का माध्य: 100, यानी समष्टि का माध्य जस का तस
- σ = 15 से तुलना कीजिए: एक बार में 36 का नमूना लेने पर फैलाव 6 गुना सिकुड़ जाता है, और 6 ठीक √36 है
15 और 36 दोनों इसलिए चुने गए हैं कि हिसाब दिमाग़ में हो जाए — 225 में 36 का भाग 6.25 है, और उसका वर्गमूल गोल 2.5। तीसरी पंक्ति पर एक बार ठहरकर देखना बनता है, क्योंकि वह देखने में ऐसी है जैसे कुछ हुआ ही न हो: सारे नमूना माध्यों का माध्य समष्टि का माध्य ही है, किसी भी नमूने के आकार पर, और यह अपेक्षा का तथ्य है, कोई अनुमान नहीं। 100 = 100 देखना ही इस पंक्ति का मक़सद है, इसीलिए इसे छापा जाता है, भले ही यह इनपुट को दोहरा रही हो।
वही समष्टि, इस बार 36 के बजाय 9 का नमूना
- नमूना आकार का चौथाई है, इसलिए प्रसरण चार गुना है: 225 / 9 = 25
- मानक त्रुटि: √25 = 5
- माध्य अब भी 100 है — नमूना छोटा करने से फैलाव बदला, और कुछ नहीं
- पहले उदाहरण से तुलना: n चौथाई हुआ और मानक त्रुटि सिर्फ़ दुगुनी हुई
यह जोड़ी वर्गमूल के नियम को ठोस बनाती है: नमूना चौथाई कीजिए और मानक त्रुटि सिर्फ़ दुगुनी होती है, क्योंकि n के साथ अनुपात में जो बदलता है वह प्रसरण है। उलटी दिशा में पढ़ें तो यही बात बताती है कि सटीकता महँगी क्यों है — चार गुना नमूना दुगुना सुधार देता है, और अगला दुगुना सुधार मूल नमूने का सोलह गुना माँगता है। हर नमूना-आकार का फ़ैसला यही सौदा है, और नीचे की संदर्भ तालिका इसे n के एक चौड़े दायरे पर दिखाती है।
एक बार में एक ही मान लेने पर फैलाव जस का तस रहता है
- n = 1 पर नमूना माध्य वही अकेला मान है, इसलिए नमूनाकरण बंटन ख़ुद समष्टि है
- प्रसरण: 225 / 1 = 225, जो σ² है
- मानक त्रुटि: √225 = 15, जो σ है
- नमूना माध्यों का माध्य अब भी 100 है
दायरे का n = 1 वाला सिरा देखने लायक है क्योंकि वही पूरे विचार को टिकाता है: एक मान का नमूना समष्टि से निकाली गई एक इकाई है, इसलिए कुछ भी औसत करके नहीं हटाया गया और मानक त्रुटि ख़ुद समष्टि का मानक विचलन है। बाक़ी हर नमूना आकार इसी शुरुआती बिंदु को √n से भाग देकर मिलता है। यह पेज n = 1 लेता है, कम से कम दो की शर्त नहीं लगाता, क्योंकि वह एक जायज़ और सिखाने वाला इनपुट है — नमूनाकरण बंटन को नमूने ने बस संकरा नहीं किया है।
सीमाएँ
सूत्र के ऊपर वाली दोनों सर्वसमिकाएँ किसी भी समष्टि और किसी भी n पर सच हैं, पर वे नमूनाकरण बंटन के सिर्फ़ पहले दो आघूर्ण बताती हैं। प्रमेय का तीसरा दावा — लगभग सामान्यता — वही है जिस पर ज़्यादातर व्यावहारिक उपयोग टिका है, और वही हिस्सा यह पेज जाँच नहीं सकता, क्योंकि n कितना बड़ा चाहिए यह इस पर निर्भर है कि नीचे का बंटन कितना तिरछा है: लगभग सममित समष्टि के लिए 10 अक्सर काफ़ी होता है, जबकि लंबी पूँछ वाले बंटन में नमूना माध्य के ठहरने से पहले कई सौ मान लग सकते हैं। ज़ोर-शोर से दोहराया जाने वाला 30 का आँकड़ा एक नियम-मात्र मानिए, नतीजा नहीं। सूत्र यह भी मान लेता है कि मान एक-दूसरे से स्वतंत्र हैं, और छोटी समष्टि से बिना प्रतिस्थापन नमूना लेने पर यह शर्त टूटती है — नमूना आकार वाला पेज वही सुधार लगाता है और इस पेज से कम लोग माँगेगा। यहाँ कुछ भी आँकड़ों से अनुमानित नहीं है: दोनों इनपुट समष्टि के मान हैं, और अगर आपके पास सिर्फ़ नमूने का मानक विचलन है, तो विश्वास अंतराल वाला पेज वह है जिसे यह फ़र्क़ पता है।
अक्सर पूछे जाने वाले सवाल
- मानक विचलन और मानक त्रुटि में क्या फ़र्क़ है?
- मानक विचलन बताता है कि अलग-अलग मान अपने माध्य से कितनी दूर बैठते हैं; मानक त्रुटि बताती है कि कोई नमूना माध्य समष्टि के माध्य से कितना दूर बैठता है। दूसरी पहली को √n से भाग देकर मिलती है, और यही भाग पूरा फ़र्क़ है: σ = 15 वाली समष्टि से 9 मान निकालें या 900, वह उतनी ही बिखरी रहती है, पर 900 मानों का माध्य 100 मानों के माध्य से तीन गुना क़रीब पहुँचता है। इसीलिए σ आँकड़ों की अपनी इकाई में रहता है जबकि मानक त्रुटि अध्ययन बड़ा होने पर सिकुड़ती जाती है — और इसीलिए विश्वास अंतराल या परीक्षण सांख्यिकी में यही संख्या जाती है।
- नमूने बड़े करने पर नमूना माध्यों का माध्य बदलता है क्या?
- नहीं, और यही नतीजा लोगों को सबसे कम विश्वसनीय लगता है। नमूनाकरण बंटन का माध्य हर नमूने के आकार पर समष्टि के माध्य के बराबर रहता है, n = 1 से लेकर ऊपर तक, क्योंकि औसत निकालना अनुमान को किसी भी दिशा में धकेलता नहीं — वह सिर्फ़ उसका फैलाव कम करता है। नमूना माध्यों का बंटन उसी केंद्र के इर्द-गिर्द पतला और ऊँचा होता जाता है। नमूने का आकार सटीकता ख़रीदता है, शुद्धता कभी नहीं: वह अनुमान का फैलाव सिकोड़ता है, उसका केंद्र हिलाता नहीं। इसके उलट पक्षपाती नमूना-विधि केंद्र को हिला देती है और कोई नमूना आकार उसे वापस नहीं ला सकता, इसीलिए इन दोनों विफलताओं को अलग-अलग रखना ज़रूरी है।
- केंद्रीय सीमा प्रमेय लागू होने के लिए नमूना कितना बड़ा होना चाहिए?
- यह समष्टि की आकृति पर निर्भर है, और कोई एक सीमा नहीं है जो सब पर लागू हो। सममित समष्टि n = 10 पर ही सभ्य व्यवहार करती है, जबकि ज़ोरदार तिरछी समष्टि में नमूना माध्य के सामान्य के क़रीब आने से पहले कई सौ मान लग सकते हैं। 30 वाला जाना-पहचाना नियम-मात्र हल्के तिरछे आँकड़ों के अनुकरण अध्ययनों से आया है और एक उचित डिफ़ॉल्ट है, प्रमेय नहीं। जो चीज़ यह पेज आकृति के बारे में कोई मान्यता रखे बिना देता है वह केंद्र और फैलाव है — माध्य और मानक त्रुटि किसी भी n पर सटीक हैं। सामान्य सन्निकटन को ही बड़ा नमूना चाहिए, और उसी पर बने विश्वास अंतराल तथा P-मान उस शर्त को विरासत में लेते हैं।
- नमूना माध्यों का प्रसरण आँकड़ों के प्रसरण से इतना छोटा क्यों होता है?
- क्योंकि औसत निकालना अलग-अलग मानों की स्वतंत्र त्रुटियों को काट देता है, और यह कटाव नमूने के आकार के अनुपात में चलता है — जबकि मानक त्रुटि, जिसकी लोग आम तौर पर तुलना करते हैं, उसके वर्गमूल के अनुपात में चलती है। σ = 15 और n = 36 पर प्रसरण 225 से 6.25 पर आ जाता है, यानी 36 गुना कम, जबकि मानक विचलन 15 से 2.5 पर, यानी सिर्फ़ 6 गुना कम। दोनों पंक्तियाँ इसीलिए छपती हैं। प्रमेय आम तौर पर प्रसरण के रूप में कहा जाता है, और इस्तेमाल मानक त्रुटि के रूप में होता है, और इन दोनों गुणकों के बीच का फ़र्क़ ही वर्गमूल है।
- क्या यह मानक त्रुटि कैलकुलेटर जैसा ही है?
- दोनों एक ही राशि निकालते हैं, पर अलग-अलग इनपुट से, और कौन-सा चाहिए यह इस पर निर्भर है कि आपके पास क्या है। यह पेज समष्टि का मानक विचलन और नमूने का आकार लेता है — वे मान जो कोई भी आँकड़ा जुटाने से पहले मौजूद होते हैं — और यह अध्ययन की योजना बनाने या n से सटीकता कैसे तय होती है यह जाँचने का सही साधन है। मानक त्रुटि कैलकुलेटर ख़ुद नमूना लेता है और उससे मानक विचलन निकालता है, जो आँकड़े हाथ में आ जाने और समष्टि का मान अज्ञात रहने पर इस्तेमाल होता है। दोनों में फ़र्क़ ठीक बीच वाले अनुमान-चरण का है, और विश्वास अंतराल वाला पेज वह जगह है जहाँ इस फ़र्क़ के परिणाम दिखते हैं।
संदर्भ
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a sample statistic as a quantity with its own distribution, which is the object this page describes) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the curve the sampling distribution approaches as the sample grows, and the table it is read from) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (the law of large numbers: sample averages settling towards the population mean as the sample grows, which is the behaviour the mean of sample means states exactly) — OpenStax (Rice University)