त्रुटि की सीमा कैलकुलेटर
नतीजा
त्रुटि की सीमा
- मानक त्रुटि
- 1.2000
- क्रांतिक मान
- 1.9842
त्रुटि की सीमा कैलकुलेटर किसी नमूने का फैलाव उस जोड़-घटाव वाले आँकड़े में बदल देता है जो किसी सर्वेक्षण के नतीजे के साथ उद्धृत किया जाता है। इसे तीन चीज़ें चाहिए, और पेज ठीक वही माँगता है: विश्वास स्तर — 90, 95 या 99% — नमूने का आकार, और यह कि जिस राशि का अनुमान लग रहा है वह कितनी बिखरी हुई निकली, यानी माध्य के मामले में मानक विचलन और प्रतिशत के मामले में अनुपात ख़ुद। हिसाब यह है कि एक क्रांतिक मान को एक मानक त्रुटि से गुणा किया जाए, और दोनों गुणक छापे जाते हैं, क्योंकि दोनों सबसे आम चूकें इन्हीं दोनों में से एक-एक में बसती हैं: जहाँ z लगना था वहाँ t का क्रांतिक मान ले लेना, या नमूने के आकार के वर्गमूल की जगह ख़ुद नमूने से भाग दे देना। नतीजे का नमूने के केंद्र से कोई लेना-देना नहीं है। त्रुटि की सीमा बताती है कि अनुमान कितना चूक सकता है, यह नहीं कि वह क्या है — 3 अंक की सीमा वाला 60% का सर्वेक्षण 57% या 63% की समष्टि से भी उतना ही आसानी से आ सकता था।
फ़ॉर्मूला
ME = z* × SE SE = s / √n SE = √(p(1 − p) / n)
- ME
- त्रुटि की सीमा — विश्वास अंतराल की आधी चौड़ाई, अनुमान की उन्हीं इकाइयों में। यह चौड़ाई नहीं, आधी चौड़ाई है क्योंकि अंतराल को अनुमान ± ME लिखा जाता है, इसलिए वही संख्या एक तरफ़ घटाई जाती है और दूसरी तरफ़ जोड़ी जाती है। इसकी इकाइयाँ अनुमान के पीछे चलती हैं: अनुपात के लिए प्रतिशत अंक, और माध्य के लिए वही जिसमें आँकड़े नापे गए थे
- z*
- क्रांतिक मान, और इस मोड में यह हमेशा n − 1 स्वतंत्रता की कोटि पर लिया गया t का मान होता है, जाना-पहचाना 1.96 नहीं। सर्वेक्षणों के आम आकारों के सामने यह फ़र्क़ छोटा लगता है, पर शून्य नहीं है और ठीक वहीं सबसे बड़ा है जहाँ त्रुटि की सीमा सबसे बड़ी होती है: n = 2 पर t का मान 12.7062 है, इसलिए चार मानक विचलन वाले दो-व्यक्ति नमूने की त्रुटि की सीमा 35.94 बनती है
- s
- नमूने का मानक विचलन, जो सिर्फ़ माध्य वाले मोड में इस्तेमाल होता है। किसी सर्वेक्षण में यह पहले से शायद ही पता होता है, और इसीलिए चुनावी सर्वेक्षण अनुपात बताते हैं — हाँ/नहीं वाले सवाल में बिखराव प्रतिशत से ही निकल आता है और अलग से कुछ अनुमान लगाना ही नहीं पड़ता
- p
- नमूने का अनुपात, जो सिर्फ़ अनुपात वाले मोड में इस्तेमाल होता है और सूत्र में भिन्न के रूप में तथा पैनल पर प्रतिशत के रूप में लिखा जाता है। चौड़ाई में इसका योगदान 50% पर अपने चरम पर होता है: आधा नमूना सहमत और आधा असहमत — किसी हाँ/नहीं सवाल की यह सबसे अनिश्चित हालत है, और इसीलिए किसी सर्वेक्षण के लिए उद्धृत त्रुटि की सीमा अक्सर p = 0.5 वाला सबसे ख़राब मामला होती है, उस सर्वेक्षण का अपना आँकड़ा नहीं
- n
- नमूने का आकार, जो √n के रूप में आता है। यही वर्गमूल वजह है कि नमूना दुगुना करने पर त्रुटि की सीमा आधी नहीं होती — वह सिर्फ़ 1.41 से भाग जाती है, इसलिए सीमा आधी करने के लिए चार गुना नमूना चाहिए। यही एकमात्र गुणक है जो शोधकर्ता के हाथ में है, क्योंकि p आँकड़ों से आता है और विश्वास स्तर यह बयान है कि जवाब कितना सतर्क होना चाहिए
इसे तब इस्तेमाल कीजिए जब आप आँकड़े जुटा चुके हों और यह जानना हो कि बताए गए आँकड़े का कितना हिस्सा शोर है, या जब आप किसी और का बताया हुआ कोई आँकड़ा पढ़ रहे हों और यह देखना हो कि वह किस चीज़ से बना है। सबसे काम की दो चीज़ें मुख्य नतीजे में नहीं, पैनल पर ही दिखती हैं: क्रांतिक मान, जो खोल देता है कि t इस्तेमाल हुआ या z, और इसलिए यह भी कि विश्लेषक ने फैलाव का अनुमान लगाने का हिसाब रखा या नहीं; और मानक त्रुटि, जो वर्गमूल का नियम दिखा देती है — नमूना चार गुना कीजिए और यह आधी हो जाती है। किसी अध्ययन की व्याख्या करने के बजाय उसकी योजना बनाने के लिए नमूने के आकार वाला पेज बेहतर औज़ार है, क्योंकि वह सवाल उलट देता है और पूछता है कि जिस त्रुटि की सीमा को आप पहले ही स्वीकार्य मान चुके हैं, उसके लिए कितने जवाब चाहिए। किसी सर्वेक्षण का नतीजा पढ़ते समय याद रखिए कि यह सीमा सिर्फ़ नमूने की भूल को ढकती है। यह नहीं बताती कि जवाब किसने दिए, सवाल भड़काऊ था या नहीं, या नमूना ऐसे तरीक़े से निकाला गया था या नहीं जिसमें समष्टि के हर व्यक्ति के चुने जाने का मौक़ा बराबर था। ये मुश्किलें n के साथ नहीं घटतीं, और बड़ा नमूना तथा छोटी त्रुटि की सीमा — यही वह तरीक़ा है जिससे कोई पक्षपाती सर्वेक्षण भरोसेमंद दिखने लगता है।
हल किए हुए उदाहरण
डिफ़ॉल्ट: 100 मापों से निकाला गया माध्य
- मानक त्रुटि: s / √n = 12 / 10 = 1.2
- क्रांतिक मान: 99 स्वतंत्रता की कोटि पर t का मान, 1.9842 — 1.9600 नहीं
- त्रुटि की सीमा: 1.9842 × 1.2 = 2.3811
- अनुमान ख़ुद कोई इनपुट नहीं है, इसलिए जवाब अंतराल नहीं, आधी चौड़ाई है
पढ़ने लायक पंक्ति क्रांतिक मान है, क्योंकि हाथ का हिसाब आम तौर पर ठीक यहीं बिगड़ता है: 100 माप बड़ा नमूना है, और 1.9842 की जगह 1.96 उठा लेने से जवाब 1.2% बदल जाता है। यहाँ यह छोटा है और n = 2 पर बहुत बड़ा, जहाँ वही अदला-बदली 35.9 अंकों को 5.5 बना देती — यानी अनिश्चितता को छह गुना कम बताना। पेज क्रांतिक मान इसीलिए छापता है कि यह क़दम जाँचा जा सके, किसी गुणा के भीतर छिपा न रहे।
1000 जवाबों से निकाला गया अनुपात
- अनुपात भिन्न के रूप में: 50% = 0.5
- प्रतिशत अंकों में मानक त्रुटि: √(0.5 × 0.5 / 1000) × 100 = 1.5811
- क्रांतिक मान: सामान्य का मान 1.9600, क्योंकि अनुपात वाला मोड z इस्तेमाल करता है
- त्रुटि की सीमा: 1.96 × 1.5811 = 3.099 प्रतिशत अंक
यह उस आँकड़े का ढाँचा है जो अख़बार उद्धृत करते हैं, और यहाँ तीन बातें अलग-अलग देखने लायक हैं। क्रांतिक मान यहाँ 1.9600 है जबकि ऊपर माध्य वाले उदाहरण में 1.9842 आया था, क्योंकि अनुपात का बिखराव पूरी तरह p से तय होता है और उसे कोई स्वतंत्रता की कोटि नहीं चाहिए। मानक विचलन वाला फ़ील्ड पैनल पर पड़ा है और बेकार है — इस मोड में बिखराव प्रतिशत से आता है, किसी अलग अनुमान से नहीं। और p = 50% सबसे ख़राब मामला है, इसलिए यह संख्या सामान्य हो जाती है: उस सर्वेक्षण के किसी भी सवाल की त्रुटि की सीमा इससे बड़ी नहीं होगी।
नौ मापों से त्रुटि की सीमा ठीक क्रांतिक मान पर आ जाती है
- मानक त्रुटि: 3 / √9 = 1, ठीक-ठीक
- 8 स्वतंत्रता की कोटि पर क्रांतिक मान: 2.306
- त्रुटि की सीमा: 2.306 × 1 = 2.306
- तीन में से दो पंक्तियाँ वही संख्या छापती हैं, जो इन इनपुटों का संयोग है, कोई नियम नहीं
यह संयोग एक बार देख लेना अच्छा है ताकि आगे चलकर इसे कोई रिश्ता न समझ लिया जाए: मानक त्रुटि ठीक 1 निकली, जिससे गुणा का क़दम बेअसर हो गया और जवाब में क्रांतिक मान ही दिखने लगा। नौ माप और तीन का मानक विचलन एक स्वाभाविक छोटे-नमूने वाली जमावट है, और यह वही t मान है जो विश्वास अंतराल वाला पेज n = 9 पर निकालता है — दोनों पेज पूरा हिसाब साझा करते हैं और सिर्फ़ इस बात में फ़र्क़ करते हैं कि नमूने का माध्य दिया गया है या नहीं, जो अंतराल को खिसकाता है।
वही आँकड़े 95% के बजाय 99% पर पढ़े गए
- मानक त्रुटि 1.2 पर वही रहती है — आँकड़ों में कुछ हिला ही नहीं
- 99% पर 99 स्वतंत्रता की कोटि के साथ क्रांतिक मान: 2.6264
- त्रुटि की सीमा: 2.6264 × 1.2 = 3.1517
- 95% वाले मामले से तुलना: 2.3811, यानी ज़्यादा विश्वास की क़ीमत 32% ज़्यादा चौड़ाई है
तीन पंक्तियों में से सिर्फ़ एक बदलती है, और तीनों को छापने का मक़सद यही है: विश्वास स्तर सिर्फ़ क्रांतिक मान को छूता है और और कुछ नहीं, जबकि नमूने का आकार सिर्फ़ मानक त्रुटि को छूता है। दोनों क़ाबू एक-दूसरे से आज़ाद हैं, और इन्हें मिला देना यह ग़लत पढ़ने का आम तरीक़ा है कि असल में बदला क्या। सौदे को नाम देना भी बनता है — 99% विश्वास ज़्यादा सही नहीं, ज़्यादा सतर्क है। यह एक चौड़ा अंतराल ख़रीदता है जो सच को ज़्यादा बार ढकता है और किसी एक मौक़े पर अनुमान को कम कसकर पकड़ता है।
सीमाएँ
त्रुटि की सीमा ग़लती के सिर्फ़ एक स्रोत को ढकती है: वह बदलाव जो पूरी समष्टि नापने के बजाय कोई नमूना लेने से आता है। यह पक्षपात के बारे में कुछ नहीं कहती, और दोनों एक-दूसरे की जगह नहीं चल सकते — किसी वेबसाइट से जुटाए हज़ार स्वयंसेवियों के नमूने की त्रुटि की सीमा छोटी हो सकती है और वह बीस अंक तक ग़लत हो सकता है, क्योंकि जिन्होंने जवाब देने का चुनाव किया वे कोई अनियमित निष्कर्ष नहीं हैं। यह मापों की स्वतंत्रता भी मान लेती है। एक ही घर के कई लोगों से पूछना, या एक ही व्यक्ति को दो बार नापना, असरदार नमूने का आकार जवाबों की गिनती से कहीं नीचे गिरा देता है, और सूत्र को यह पता लगाने का कोई तरीक़ा नहीं; सीमा जितनी चाहिए उससे पतली निकल आती है। माध्य और अनुपात — दोनों सूत्र बड़े नमूने वाले सन्निकटन हैं: अनुपात वाला ख़ास तौर पर तब भरोसेमंद नहीं रहता जब n·p या n·(1 − p) छोटा हो, जो दुर्लभ श्रेणियों के साथ होता है — 100 के नमूने में 2% की दर को सममित जोड़-घटाव के साथ बिल्कुल नहीं बताना चाहिए। और त्रुटि की सीमा किसी एक अनुमान को अकेले में बयान करती है। दो समूहों की तुलना के लिए यह ग़लत औज़ार है, क्योंकि वहाँ जो मायने रखता है वह फ़र्क़ की त्रुटि की सीमा है, जो दोनों अलग-अलग सीमाओं का जोड़ नहीं होती — हाँ, तब तक नहीं जब तक समूह स्वतंत्र न हों।
अक्सर पूछे जाने वाले सवाल
- 3% की त्रुटि की सीमा का असल में क्या मतलब है?
- इसका मतलब है कि अगर वही सर्वेक्षण कई बार दोहराया जाए, तो बनने वाले अंतरालों में से क़रीब 95% — यानी बताया गया आँकड़ा जमा-माइनस 3 अंक — समष्टि का असली मान अपने भीतर रखेंगे। इसका मतलब यह नहीं कि असली मान निश्चित रूप से 3 अंक के भीतर है, और यह भी नहीं कि सर्वेक्षण 3 अंक तक ग़लत है। इससे दो बातें निकलती हैं जो छूट जाना आसान है। असली मान या तो अंतराल के भीतर है या बाहर, इसलिए वह 95% इस एक नतीजे के बजाय विधि का बखान करता है। और समूहों की तुलना करते समय सीमाएँ जुड़ती चली जाती हैं: अगर 3 अंक की सीमा वाले सर्वेक्षण में दो उम्मीदवार 4 अंक के फ़ासले पर हैं, तो मुक़ाबला किसी सीधे-सादे मतलब में 'सीमा के भीतर' नहीं है — उस फ़र्क़ की अपनी त्रुटि की सीमा होती है, जो दोनों में से किसी से भी बड़ी है।
- नमूना बड़ा होने पर त्रुटि की सीमा कम क्यों होती है, पर उसी अनुपात में क्यों नहीं?
- क्योंकि नमूने का आकार सूत्र में वर्गमूल के भीतर आता है। 100 से 400 जवाबों पर जाने से त्रुटि की सीमा आधी हो जाती है, और 400 से 1600 पर जाने से फिर आधी — हर बार आधा करने की क़ीमत चार गुना नमूना है। यह सर्वेक्षण डिज़ाइन का सबसे भारी तथ्य है, और यही समझाता है कि चुनावी सर्वेक्षण कुछ सौ से लेकर दो हज़ार के आसपास जवाबों पर क्यों आ टिकते हैं: पहला हज़ार उपलब्ध सटीकता का ज़्यादातर हिस्सा ख़रीद लेता है, और अगला हज़ार उससे आधा। इसी वजह से बेहतर विश्लेषण से त्रुटि की सीमा सुधर भी नहीं सकती। एकमात्र लीवर ज़्यादा आँकड़े हैं, और वह वर्गमूल पर चलता है।
- क्या बड़ी त्रुटि की सीमा बुरी है?
- वह ज़्यादा ईमानदार है, बुरी नहीं। चौड़ा अंतराल सच को अपने भीतर लेने की ज़्यादा संभावना रखता है, इसलिए 99% विश्वास पर ±5 अंक बताने वाला अध्ययन 90% पर ±3 बताने वाले से ज़्यादा सुरक्षित दावा कर रहा है — दोनों की तुलना तब तक नहीं हो सकती जब तक विश्वास स्तर बताया न जाए। जो सचमुच बुरा है वह है बिना बताई गई त्रुटि की सीमा, या विश्वास स्तर के बिना उद्धृत की गई सीमा, क्योंकि तब पाठक यह नहीं जान पाता कि उस आँकड़े में कितना वज़न है। चौड़ी सीमा जो दूसरी बात बताती है वह बस इतनी है कि नमूना छोटा था, जो कोई ख़राबी नहीं, सूचना है: यह कहती है कि यह अध्ययन बारीक़ फ़र्क़ नहीं निकाल सकता, और जो अध्ययन नहीं निकाल सकता उसे ऐसे नहीं पढ़ा जाना चाहिए जैसे उसने निकाल लिया हो।
- पेज 0% या 100% का अनुपात क्यों ठुकरा देता है?
- क्योंकि वहाँ सूत्र ढह जाता है। किसी अनुपात की मानक त्रुटि √(p(1 − p)/n) है, और p = 0 या p = 1 पर p(1 − p) का मान शून्य होता है, इसलिए त्रुटि की सीमा ठीक शून्य निकलती है। '60% ± 0 अंक' छापना निश्चितता का वह दावा है जिसे कोई नमूना उठा नहीं सकता — यह कहता है कि समष्टि का मान 60% है, जबकि आँकड़े बस इतना दिखाते हैं कि इस नमूने में कोई भी उस श्रेणी के बाहर नहीं गिरा। शून्य या पूरी गिनती को सँभालने के सही तरीक़े हैं भी, और उन सबमें ख़ाली कोष्ठक पर भरोसा करने के बजाय गिनतियों में कुछ जोड़ा जाता है; उनमें से कोई भी सीधी-सादी त्रुटि की सीमा नहीं है, इसलिए पेज ऐसी संख्या लौटाने से इनकार कर देता है जिसे निश्चितता पढ़ा जाएगा। उलटी तरफ़ देख लीजिए: माध्य वाले मोड में मानक विचलन शून्य भरने पर पेज कुछ नहीं कहता, क्योंकि तब दोनों पंक्तियाँ शून्य छापती हैं और चौड़ाई कहाँ से आई, यह साफ़ दिख जाता है।
- क्या त्रुटि की सीमा पक्षपाती नमूने का हिसाब रखती है?
- नहीं, और यह पूरे विचार की सबसे बड़ी सीमा है। त्रुटि की सीमा नमूने के बदलाव को नापती है — ग़लती का वह हिस्सा जो पूरी समष्टि के बजाय उसका कुछ हिस्सा देखने से आता है। पक्षपात एक दूसरे क़िस्म की ग़लती है, जो नमूना चुनने के तरीक़े या सवाल पूछने के ढंग से पैदा होती है, और नमूना बढ़ने के साथ वह घटती नहीं। दस हज़ार लोगों के स्वैच्छिक ऑनलाइन सर्वेक्षण की त्रुटि की सीमा एक प्रतिशत अंक हो सकती है और वह फिर भी पंद्रह अंक ग़लत हो सकता है, क्योंकि जिन्होंने जवाब दिया वे समष्टि से निकाला गया कोई अनियमित चयन नहीं हैं। बड़े नमूने नमूने की भूल छोटी कर देते हैं; वे पक्षपात को ज़्यादा सटीक दिखाने लगते हैं। कोई भी बताई गई सीमा पढ़ते समय पहले यह पूछिए कि नमूना कैसे निकाला गया था।
- त्रुटि की सीमा और मानक त्रुटि में क्या फ़र्क़ है?
- मानक त्रुटि अनुमान का कच्चा फैलाव है, और त्रुटि की सीमा उस फैलाव को विश्वास स्तर पर निर्भर एक क्रांतिक मान से गुणा करके मिलती है। यानी मानक त्रुटि सिर्फ़ आँकड़ों का गुण है, और त्रुटि की सीमा यह बयान है कि आप उस पर कितना भरोसा रखना चाहते हैं। 95% वाले अंतराल के लिए गुणक लगभग दो है, और इसीलिए ये दोनों संख्याएँ अक्सर एक-दूसरे से दो गुने के भीतर रहती हैं और लोग इन्हें मिला देते हैं। इसी वजह से दोनों पैनल पर छपती हैं: मानक त्रुटि बताती है कि नमूने में कितनी सूचना है, और त्रुटि की सीमा बताती है कि उस सूचना से आपने क्या दावा करने का फ़ैसला किया है।
संदर्भ
- 1.3.5.6. Measures of Scale — e-Handbook of Statistical Methods (the standard deviation the standard error is built from, and the n − 1 denominator the degrees of freedom come from) — National Institute of Standards and Technology (NIST)
- 6.2 Using the Normal Distribution — Introductory Statistics 2e (the critical value that multiplies the standard error, and the tail areas a confidence level is split into) — OpenStax (Rice University)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the sampling distribution whose spread is the standard error, which is what the plus-or-minus sign is describing) — National Institute of Standards and Technology (NIST)