मानक त्रुटि कैलकुलेटर
नतीजा
मानक त्रुटि
- मानक विचलन
- 2.1381
- माध्य
- 5.0000
- संख्या
- 8
मानक त्रुटि कैलकुलेटर माध्य की मानक त्रुटि या किसी अनुपात की मानक त्रुटि निकालता है — जो भी आपके पास आँकड़ों के रूप में हो। माध्य वाले तरीक़े में यह नमूना ख़ुद लेता है, यानी संख्याओं की एक सूची, और मानक विचलन, गिनती तथा मानक त्रुटि लौटाता है, जो मानक विचलन को √n से भाग देकर निकलती है। अनुपात वाले तरीक़े में काम करने के लिए कोई सूची नहीं होती: हाँ/नहीं वाले सवाल का फैलाव प्रतिशत से ही तय हो जाता है, इसलिए पन्ना नमूने का आकार और प्रतिशत लेता है, मानक विचलन को √(p(1 − p)) × 100 के रूप में निकालता है, और उसी √n से भाग देता है। दोनों तरीक़े इसलिए एक ही रास्ते से एक ही राशि तक पहुँचते हैं, और चारों पंक्तियाँ पूरी शृंखला दिखाती हैं, सिर्फ़ उसका आख़िरी सिरा नहीं। यह पन्ना यह नहीं बता सकता कि आप जिस संख्या को देख रहे हैं वह टिकाऊ है या नहीं: वह नमूने के आकार पर निर्भर है, और नमूना-बंटन वाला पन्ना वह जगह है जहाँ 1/√n का नियम खोला गया है।
फ़ॉर्मूला
SE = s / √n s = √( Σ(xᵢ − x̄)² / (n − 1) ) s = √(p(1 − p)) × 100
- SE
- मानक त्रुटि — अनुमान का मानक विचलन, और इस पन्ने का मुख्य नतीजा। यह आँकड़ों के बारे में नहीं, अनुमान के बारे में सवाल का जवाब देती है: नमूना दोहराया जाए तो कोई नमूना-माध्य समष्टि के माध्य से आम तौर पर कितनी दूर बैठेगा। इसी से विश्वास अंतराल बनता है और इसी से भाग देकर कोई परीक्षण सांख्यिकी निकलती है, इसीलिए इसे अलग से निकालना बनता है
- s
- नमूने का मानक विचलन, जिसमें हर n − 1 होता है। माध्य वाले तरीक़े में मानक त्रुटि इसी से निकलती है, और यह अपनी अलग पंक्ति में इसलिए छपता है कि भाग की जाँच हो सके। n के बजाय n − 1 ही इसे समष्टि के फैलाव का निष्पक्ष अनुमान बनाता है — n लेने पर फैलाव थोड़ा कम बताया जाता, और यह कमी ठीक वहीं सबसे बड़ी होती है जहाँ नमूने सबसे छोटे हैं
- n
- नमूने में कितने प्रेक्षण हैं — गिनती, जो अपनी अलग पंक्ति में भी छपती है। यह वर्गमूल के नीचे आती है, इसीलिए मानक त्रुटि धीरे-धीरे घटती है: दस गुना आँकड़ा लगभग तीन गुना छोटी मानक त्रुटि दिलाता है। अनुपात वाले तरीक़े में यह सूची से निकली गिनती नहीं, नमूने का आकार वाला ख़ाना है, क्योंकि प्रतिशत अपने साथ कोई सूची लेकर नहीं आता
- x̄
- नमूने का माध्य, जो इसलिए छपता है कि मानक विचलन के अंकगणित का एक दिखता हुआ केंद्र रहे। मानक त्रुटि में इसका कोई हिस्सा नहीं — मानक त्रुटि फैलाव और नमूने के आकार का गुण है, इस बात का नहीं कि आँकड़े कहाँ बैठे हैं — इसीलिए पूरे आँकड़ों को किसी भी अचर से खिसका दीजिए, मानक त्रुटि वही रहती है
- p
- नमूने का अनुपात, सूत्र में भिन्न के रूप में और पैनल पर प्रतिशत के रूप में। अनुपात वाले तरीक़े में यह मानक विचलन की जगह पूरी तरह ले लेता है: हाँ/नहीं वाले सवाल का फैलाव प्रतिशत का फलन है, बँटवारा बराबर हो तो सबसे बड़ा, और प्रतिशत 0 या 100 के पास जाते-जाते शून्य तक सिकुड़ता हुआ। × 100 का काम नतीजे को वापस प्रतिशत अंकों में लाना है ताकि वह उसी प्रतिशत के बग़ल पढ़ा जा सके जिससे वह आया
इसे तब लगाइए जब आँकड़े हाथ में हों और किसी अनुमान की मानक त्रुटि चाहिए — हाथ से विश्वास अंतराल बनाने, किसी रिपोर्ट की संख्या जाँचने, या यह देखने कि किसी नतीजे की चौड़ाई में से कितनी आँकड़ों के फैलाव से आती है और कितनी नमूने के आकार से। मानक विचलन और गिनती साथ छापने से काम का यह बँटवारा दिखने लगता है: आँकड़े बदलिए तो मानक विचलन की पंक्ति हिलती है, सिर्फ़ नमूने का आकार बदलिए तो मानक त्रुटि की पंक्ति हिलती है और मानक विचलन अपनी जगह टिका रहता है। दो तरीक़े इसलिए हैं कि दो सबसे आम अनुमानों को अलग-अलग इनपुट चाहिए। माध्य को नमूना चाहिए, क्योंकि यह पहले से कोई नहीं बता सकता कि मापन कितने बिखरे होंगे; अनुपात को नहीं, क्योंकि उसका फैलाव उसके अपने मान से निकलता है, और इसीलिए सर्वेक्षण सिर्फ़ नमूने के आकार से त्रुटि की सीमा बता पाते हैं। कोई भी तरीक़ा यह नहीं जाँचता कि नमूना इतना बड़ा है कि अनुमान लगभग सामान्य माना जाए। वह इस पर निर्भर है कि नीचे का बंटन कितना तिरछा है, और अनुपात वाले तरीक़े के लिए n·p तथा n·(1 − p) पर एक ज़्यादा सटीक अंगूठा-नियम है जिसे यह पन्ना लागू नहीं करता।
हल किए हुए उदाहरण
डिफ़ॉल्ट: आठ संख्याएँ, मानक विचलन लगभग 2.14
- गिनती: आठ संख्याएँ। माध्य: (2 + 4 + 4 + 4 + 5 + 5 + 7 + 9) / 8 = 40 / 8 = 5
- 5 से वर्गित विचलनों का जोड़ 32 बैठता है, इसलिए नमूना प्रसरण 32 / 7 = 4.5714
- मानक विचलन: √4.5714 = 2.1381
- मानक त्रुटि: 2.1381 / √8 = 2.1381 / 2.8284 = 0.7559
- यानी 2.1381 आँकड़ों के बारे में एक तथ्य है और 0.7559 अनुमान के बारे में, और बीच में सिर्फ़ √8 से भाग है
संख्याएँ 5 के दोनों तरफ़ बिखरी हैं और कोई भी बहुत दूर नहीं है, और यही इन्हें अच्छा डिफ़ॉल्ट बनाता है: माध्य गोल संख्या है और मानक विचलन नहीं, इसलिए आख़िरी दो पंक्तियाँ एक-दूसरे से गड्ड-मड्ड नहीं हो सकतीं। पैनल को ऊपर से नीचे पढ़ना ही असली बात है। आँकड़ों की सूची लिखते समय संख्याओं के बीच अर्धविराम रखिए — जैसे 2; 4; 4; 4; 5; 5; 7; 9 — क्योंकि कुछ भाषाओं में अल्पविराम दशमलव का चिह्न माना जाता है और तब सूची बँटने के बजाय एक ही संख्या बन जाती है। इस तरीक़े में नमूने का आकार और प्रतिशत वाले ख़ाने बेकार पड़े रहते हैं।
नौ संख्याएँ, इस तरह चुनी गईं कि मानक त्रुटि ठीक 1 आए
- माध्य: (3 × 4 + (−3) × 4 + 0) / 9 = 0
- वर्गित विचलन: चार 9, चार 9 और एक 0, जिनका जोड़ 72
- नमूना प्रसरण: 72 / 8 = 9, इसलिए मानक विचलन 3
- मानक त्रुटि: 3 / √9 = 3 / 3 = 1
- यानी मानक त्रुटि ठीक 1 बैठी, और यह संयोग नहीं: 3 / √9 = 1 होना ही इस सूची के चुनाव की वजह थी
नौ प्रेक्षण इतने कम हैं कि n − 1 वाला हर साफ़-साफ़ मायने रखता है: 8 के बजाय 9 से भाग देने पर प्रसरण 8 और मानक विचलन 2.8284 बनता, और मानक त्रुटि 1 के बजाय 0.9428 आती। यही वह संशोधन है जो अपना काम कर रहा है — छोटे नमूने में देखा गया फैलाव समष्टि के फैलाव से ज़रा कम आता है, और गिनती से एक कम से भाग देकर उसकी भरपाई हो जाती है। n = 9 और s = 3 की यही जोड़ी विश्वास अंतराल वाला पन्ना भी लेता है, और उसका अंतराल ठीक ±2.306 पर आता है क्योंकि 8 स्वतंत्रता की कोटि पर t का मान 2.306 है।
अनुपात को आँकड़ों की सूची की ज़रूरत नहीं
- अनुपात भिन्न के रूप में: 60% = 0.6
- मानक विचलन प्रतिशत अंकों में: √(0.6 × 0.4) × 100 = 0.4899 × 100 = 48.9898
- मानक त्रुटि: 48.9898 / √100 = 48.9898 / 10 = 4.899
- आँकड़ों की सूची पूरी तरह नज़रअंदाज़ हो जाती है — गिनती की पंक्ति सूची से नहीं, नमूने के आकार वाले ख़ाने से भरती है
- यानी इस तरीक़े में दो ही ख़ाने जवाब बनाते हैं: अनुपात का प्रतिशत और नमूने का आकार
आँकड़ों का ख़ाना अब भी स्क्रीन पर है और अब भी एक सूची रखे हुए है, और जवाब में उसका कुछ भी इस्तेमाल नहीं होता: इस तरीक़े में फैलाव प्रतिशत से आता है और नमूने का आकार अपने अलग ख़ाने से। इसीलिए मानक विचलन की पंक्ति 48.99 पढ़ती है — हाँ/नहीं वाले सवाल के लिए यह अजीब-सा दिखने वाला आँकड़ा है। वह 0 और 100 में कूटबद्ध किए गए हाँ/नहीं चर का मानक विचलन है, और यहाँ उसका इकलौता काम √n से भाग देना है। यही बनावट नमूना आकार वाले पन्ने पर भी दिखती है, जहाँ कोई प्रतिशत ज्ञात होने से पहले अध्ययन की योजना बनाने के लिए सबसे ख़राब स्थिति p = 0.5 ली जाती है।
दो प्रेक्षण, जहाँ n − 1 वाला हर सबसे ज़्यादा काम कर रहा है
- माध्य: 5
- वर्गित विचलन: 25 और 25, जिनका जोड़ 50
- नमूना प्रसरण: 50 / 1 = 50, इसलिए मानक विचलन √50 = 7.0711
- मानक त्रुटि: 7.0711 / √2 = 7.0711 / 1.4142 = 5
- यानी मानक त्रुटि आँकड़ों के परिसर के ठीक आधे पर आ गई
दो प्रेक्षणों के साथ मानक विचलन बस उन दोनों के बीच की दूरी का आधा होता है — n − 1 वाला हर एक ही स्वतंत्रता की कोटि छोड़ता है, और सूत्र ऐसी चीज़ में बदल जाता है जिसे निकाला नहीं, देखा जा सकता है। फिर मानक त्रुटि वही मानक विचलन √2 से भाग देकर आती है, जो यहाँ 5 है। यह माध्य वाले तरीक़े में पन्ना जितना छोटा नमूना स्वीकार करता है, और इसे एक बार आज़माकर देख लेना बनता है कि दो संख्याओं से बना अनुमान असल में कितना चौड़ा होता है: मानक त्रुटि आँकड़ों के परिसर के आधे पर आती है।
सीमाएँ
यह पन्ना अनुमान की मानक त्रुटि बताकर रुक जाता है और उसे अंतराल या परीक्षण में बदलने से पहले थम जाता है। यह सीमा जान-बूझकर है: अंतराल को क्रांतिक मान चाहिए, जो विश्वास स्तर पर और इस पर निर्भर है कि फैलाव नमूने से निकालना पड़ा या नहीं, और परीक्षण को तुलना के लिए दूसरी सांख्यिकी चाहिए। दोनों बग़ल के पन्नों पर हैं, और यहाँ का अंकगणित दोनों का इनपुट है, किसी का विकल्प नहीं। माध्य वाला तरीक़ा यह मानता है कि प्रेक्षण स्वतंत्र हैं, जो एक ही व्यक्ति पर दोहराए गए मापन, जोड़ीदार मिलान, और स्कूलों के भीतर विद्यार्थियों जैसे समूहों में बँटे आँकड़ों पर लागू नहीं होता; इन तीनों में असरदार नमूना आकार गिनती से छोटा होता है और मानक त्रुटि ज़रूरत से छोटी आती है। यह यह भी मानता है कि सूची में वे सारे प्रेक्षण हैं जो आप शामिल करना चाहते थे — मानक त्रुटि उसी से निकलती है जो लिखा गया है, और ग़लती से छूटा कोई बाहरी मान उसे संकरा कर देता है। अनुपात वाले तरीक़े की अपनी अलग चेतावनी है: उसका सूत्र बड़े नमूने का सन्निकटन है जो सफलताओं या असफलताओं की गिनती कम होने पर बुरी तरह बिगड़ जाता है, इसलिए ठीक-ठाक नमूने से मिले 0 या 100 के क़रीब के प्रतिशत के लिए इस मानक त्रुटि से अच्छा किसी सटीक अंतराल से काम चलता है। कोई भी तरीक़ा यह नहीं आँकता कि अनुमान में पूर्वाग्रह है या नहीं, और उसे कोई मानक त्रुटि पकड़ भी नहीं सकती।
अक्सर पूछे जाने वाले सवाल
- मानक विचलन और मानक त्रुटि में क्या फ़र्क़ है?
- मानक विचलन बताता है कि अलग-अलग मान अपने माध्य से कितनी दूर बैठते हैं; मानक त्रुटि बताती है कि नमूने का माध्य समष्टि के माध्य से कितनी दूर बैठता है। दूसरी पहली को √n से भाग देकर निकलती है, और पूरा रिश्ता यही भाग है — इसीलिए दोनों छपते हैं। मानक विचलन आँकड़ों का गुण है और ज़्यादा आँकड़े जुटाने से नहीं बदलता, जबकि मानक त्रुटि नमूना बढ़ते-बढ़ते सिकुड़ती जाती है। पैनल पर जाँचने का एक आसान तरीक़ा है: संख्याएँ बदलिए तो दोनों पंक्तियाँ हिलती हैं; सिर्फ़ गिनती बदलिए तो मानक विचलन अपनी जगह रहता है और मानक त्रुटि नीचे गिरती है।
- यह पन्ना n के बजाय n − 1 से भाग क्यों देता है?
- क्योंकि फैलाव नापते समय केंद्र के तौर पर नमूने का अपना माध्य लिया जाता है, और वह असली समष्टि-माध्य की तुलना में आँकड़ों के ज़्यादा पास बैठता है — इसलिए वर्गित विचलनों का सीधा औसत व्यवस्थित रूप से ज़रा छोटा आता है। गिनती से एक कम से भाग देकर उसकी भरपाई हो जाती है। यह असर छोटे नमूनों पर सबसे बड़ा है: दो प्रेक्षणों पर यह प्रसरण दुगना कर देता है, और सौ प्रेक्षणों पर यह 1% का सुधार भर रह जाता है। n से भाग देना उस नमूने का बयान करने के लिए ग़लत नहीं है जो आपके पास है; वह उस समष्टि के फैलाव का अनुमान लगाने के लिए ग़लत है जिससे वह आया, और मानक त्रुटि ठीक उसी के लिए होती है।
- बिना कोई आँकड़ा दिए किसी अनुपात की मानक त्रुटि कैसे निकालूँ?
- अनुपात अपना फैलाव ख़ुद साथ लाता है, इसलिए कोई सूची नहीं चाहिए — सिर्फ़ नमूने का आकार और प्रतिशत। दोनों नतीजों को 0 और 100 के रूप में कूटबद्ध कीजिए और मानक विचलन √(p(1 − p)) × 100 निकलता है, जो बँटवारा बराबर होने पर सबसे बड़ा होता है और प्रतिशत किसी भी सिरे की ओर जाते-जाते शून्य की तरफ़ सिकुड़ता जाता है। 100 में से 60% के लिए वह √(0.6 × 0.4) × 100 = 48.9898 बनता है, और √100 से भाग देने पर मानक त्रुटि 4.899 प्रतिशत अंक आती है। यही ख़ानों की जोड़ी त्रुटि की सीमा वाला पन्ना भी लेता है, जहाँ मानक त्रुटि को क्रांतिक मान से गुणा करके एक जमा-माइनस बनाया जाता है।
- ज़्यादा आँकड़े जोड़ते जाने पर मानक त्रुटि घटती जाती है?
- हाँ, पर सिर्फ़ नमूने के आकार के वर्गमूल के अनुपात में। 100 प्रेक्षणों से 400 तक जाने पर मानक त्रुटि आधी हो जाती है; एक और आधा करने की क़ीमत 1600 है। इसीलिए किसी अध्ययन की योजना बनाते समय मानक त्रुटि ही वह संख्या है जिस पर नज़र रखनी चाहिए, और इसीलिए एक बहुत बड़े नमूने का सिर्फ़ बड़े नमूने पर जो फ़ायदा है उसे बढ़ा-चढ़ाकर आँकना आसान है। इसके उलट मानक विचलन की पंक्ति लगभग अपनी जगह टिकी रहती है — ज़्यादा आँकड़े नीचे की समष्टि को कम बिखरा नहीं कर देते, वे सिर्फ़ उसके केंद्र का अनुमान ज़्यादा सटीक कर देते हैं।
- मानक त्रुटि शून्य होने का क्या मतलब है?
- या तो नमूने का हर प्रेक्षण एक जैसा था, या अनुपात 0% या 100% था — दोनों हालतों में सूत्र को काम करने लायक़ कोई फैलाव नहीं मिलता और वह शून्य लौटा देता है। शब्दशः पढ़ें तो शून्य मानक त्रुटि कहती है कि अनुमान बिलकुल सटीक है, और यह ऐसा दावा है जिसे आँकड़े उठा ही नहीं सकते: चार एक जैसे मापनों का नमूना इस बात का सबूत है कि फैलाव छोटा है, इस बात का नहीं कि फैलाव शून्य है। पन्ना शून्य ही लौटाता है, त्रुटि नहीं, क्योंकि अंकगणित ठीक है और वजह बाक़ी पंक्तियों पर दिख रही होती है — पर ठीक-ठीक शून्य मानक त्रुटि को इस संकेत की तरह पढ़ना चाहिए कि नमूना इतना छोटा या इतना एकरूप है कि फैलाव के बारे में कुछ कह ही नहीं सकता।
- क्या यह केंद्रीय सीमा प्रमेय वाले कैलकुलेटर जैसा ही है?
- दोनों अलग-अलग इनपुट से एक ही राशि निकालते हैं, और कौन-सा चाहिए यह इस पर निर्भर है कि आपके पास क्या है। यह पन्ना नमूना लेता है — संख्याओं की सूची, या एक प्रतिशत और एक आकार — और आँकड़े हाथ में आ जाने पर यही काम आता है। केंद्रीय सीमा प्रमेय वाला पन्ना समष्टि का मानक विचलन और नमूने का आकार लेता है, यानी वे मान जो कुछ भी जुटाने से पहले मौजूद होते हैं, और अध्ययन की योजना बनाते समय या यह देखते समय कि मानक त्रुटि n पर कैसे प्रतिक्रिया देती है, वही काम आता है। दोनों में फ़र्क़ ठीक बीच में पड़ा वह अनुमान का क़दम है, इसीलिए जब कभी नमूने का मानक विचलन समष्टि के मान के बराबर निकले, दोनों के नतीजे मिल जाते हैं।
संदर्भ
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (the sample standard deviation and the n − 1 denominator the standard error is built from) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the sampling distribution of a statistic, whose spread is what the standard error measures) — National Institute of Standards and Technology (NIST)
- 1.3.5.1. Measures of Location — e-Handbook of Statistical Methods (the sample mean printed alongside the spread, and why the two are reported together) — National Institute of Standards and Technology (NIST)