नमूना आकार कैलकुलेटर
नतीजा
ज़रूरी नमूने का आकार
- क्रांतिक मान
- 1.9600
नमूना आकार कैलकुलेटर उस सवाल का जवाब देता है जो सर्वेक्षण से पहले आता है: जिस त्रुटि की सीमा पर आप राज़ी हैं, उस तक पहुँचने के लिए कितने जवाब चाहिए? इसे एक विश्वास स्तर, एक लक्षित त्रुटि की सीमा और अंदाज़े से एक अनुपात दीजिए, और यह वह सबसे छोटा नमूना लौटाता है जो उस लक्ष्य को पूरा करता है। सूत्र वही त्रुटि की सीमा का उलटा रूप है — वही संबंध जिसे विश्वास अंतराल वाला पन्ना दूसरी दिशा में लगाता है, यहाँ चौड़ाई के बजाय नमूने के लिए हल किया हुआ। जब सर्वेक्षण किसी छोटी समष्टि को कवर करता है, तब सीमित समष्टि संशोधन जवाब को छोटा कर देता है, और किसी एक कारख़ाने या एक स्कूल के लिए वह उसे बहुत छोटा कर देता है। यह जानना भी ज़रूरी है कि यह गिनती तय करती है कि कितने जवाब चाहिए, यह नहीं कि कितने लोगों से पूछना है।
फ़ॉर्मूला
n₀ = z² · p (1 − p) / e² छोटी समष्टि: n = n₀ / ( 1 + (n₀ − 1) / N )
- z
- विश्वास स्तर का क्रांतिक मान — 95% पर 1.9600, 90% पर 1.6449 और 99% पर 2.5758। यह अपनी अलग पंक्ति में इसलिए छपता है क्योंकि सूत्र में यही एक संख्या है जो समष्टि के बारे में आपके अनुमानों से नहीं, विश्वास स्तर से आती है
- p
- वह अनुपात जिसके मिलने की उम्मीद है, दशमलव में। चारों में यही एक इनपुट अंदाज़ा है, और यह p(1 − p) के रूप में आता है, जो p = 0.5 पर सबसे बड़ा होता है — इसलिए 50% भरना वह अनुमान है जो सबसे बड़ा और सबसे सुरक्षित नमूना देता है
- e
- त्रुटि की सीमा, दशमलव में — वह आधी चौड़ाई जिसे आप स्वीकार करते हैं, उसी इकाई में जिसमें अनुपात है। हर में यह वर्गित होती है, इसीलिए इसे आधा करने पर नमूना लगभग चार गुना हो जाता है
- n₀
- इतनी बड़ी समष्टि के लिए नमूने का आकार जहाँ समष्टि का आकार मायने नहीं रखता। समष्टि अज्ञात हो तो जवाब यही है, और अज्ञात न हो तो यह संशोधन का इनपुट है, आख़िरी जवाब नहीं
- N
- समष्टि का आकार, जिसे अज्ञात या व्यवहार में असीमित होने पर 0 भरा जाता है। संशोधन n₀ को n₀/N से बड़ी किसी संख्या से भाग देता है, इसलिए संशोधित नमूना हमेशा N से नीचे ही आता है — जितने लोग मौजूद हैं उससे ज़्यादा माँगना इस सूत्र से हो ही नहीं सकता
इसे आँकड़े जुटाने से पहले लगाइए, जब भी नमूने की क़ीमत असली हो — हर जवाब पर कुछ देने वाला सर्वेक्षण, हर नमूने पर दाम लेने वाला प्रयोगशाला मापन, या भर्ती के लक्ष्य वाला क्लिनिकल अध्ययन। फ़ैसलों का क्रम यह है: पहले वह त्रुटि की सीमा तय कीजिए जिसके साथ जी सकते हैं, फिर विश्वास स्तर, फिर अनुपात का अंदाज़ा, और फिर नमूने का आकार पढ़िए। इनमें सिर्फ़ पहला अध्ययन के बारे में आपका निर्णय है; बाक़ी दो या तो परिपाटी हैं या अंदाज़े। जवाब अगर वहन से बाहर हो तो ईमानदार क़दम यही है कि त्रुटि की सीमा चौड़ी कर दी जाए और रिपोर्ट में यह लिख दिया जाए, क्योंकि जिस त्रुटि की सीमा का ख़र्च न उठाया जा सके वह लक्ष्य नहीं है। समष्टि का आकार तब भरिए जब वह सचमुच छोटी हो — कुछ हज़ार से नीचे — क्योंकि वहाँ संशोधन ठोस होता है और उसे नज़रअंदाज़ करने का मतलब है अध्ययन की ज़रूरत से कहीं ज़्यादा लोगों को जुटाना।
हल किए हुए उदाहरण
95% विश्वास और ±5 अंकों पर राष्ट्रीय सर्वेक्षण
- 95% विश्वास पर क्रांतिक मान: 1.96
- p = 0.5 पर गुणनफल p(1 − p) = 0.25, जो उसका सबसे बड़ा संभव मान है
- n₀ = 1.96² × 0.25 / 0.05² = 3.8416 × 0.25 / 0.0025 = 384.1459
- पूरे व्यक्ति तक ऊपर की ओर पूर्णांकन: 385 जवाब
- यानी अगर लोगों से पूछने की संख्या चाहिए तो यह 385 नहीं, उससे ज़्यादा होगी — यह गिनती जवाबों की है
385 वही संख्या है जिस पर वह जाना-पहचाना दावा टिका है कि लगभग हज़ार लोगों का सर्वेक्षण तीन अंकों के भीतर सही होता है — सीमा ±3 तक कसिए और जवाब 1068 बन जाता है, जहाँ से वह आँकड़ा आता है। समष्टि का आकार 0 पर छोड़ा गया क्योंकि राष्ट्रीय सर्वेक्षण देश का नगण्य अंश होता है, और उस अनुपात पर संशोधन जवाब को एक व्यक्ति से भी कम बदलता।
वही सर्वेक्षण, ज़्यादा कसी ±3 अंकों की सीमा के साथ
- क्रांतिक मान 1.96 पर वही रहा, क्योंकि विश्वास स्तर नहीं बदला
- n₀ = 1.96² × 0.25 / 0.03² = 0.9604 / 0.0009 = 1067.0719
- ऊपर की ओर पूर्णांकन: 1068 जवाब
- 385 से तुलना कीजिए: सीमा 1.667 के गुणक से घटी और नमूना 2.78 के गुणक से बढ़ा, जो 1.667² है
- यानी सटीकता चुकता दर से ख़रीदी जाती है, सीधे अनुपात में नहीं
सटीकता चुकता दर से ख़रीदी जाती है। ±5 से ±3 अंकों तक जाना काम में 67% की बढ़ोतरी नहीं, 178% की बढ़ोतरी है, क्योंकि त्रुटि की सीमा हर में वर्गित होती है। व्यावहारिक नतीजा यह है कि सस्ते में कितना सटीक सर्वेक्षण हो सकता है, इसकी एक सीमा होती है, और ±3 अंकों से कसी सीमा का ऐलान हज़ारों के नमूने का मतलब रखता है — और ठीक उसी दायरे में जवाब न देने का झुकाव उस नमूना-त्रुटि से ज़्यादा मायने रखने लगता है जिसे यह सूत्र क़ाबू में करता है।
1000 कर्मचारियों वाली कंपनी का स्टाफ़ सर्वेक्षण
- बिना संशोधन वाला आँकड़ा अब भी 384.1459 है, क्योंकि उसे समष्टि के बारे में अभी पता नहीं
- संशोधन: 384.1459 / ( 1 + 383.1459 / 1000 ) = 384.1459 / 1.3831459 = 277.73
- ऊपर की ओर पूर्णांकन: 278 कर्मचारी
- यह कुल कर्मचारियों का 28% है, उस 38% के बजाय जो बिना संशोधन वाला आँकड़ा बताता
- यानी संशोधन वही है जो छोटी समष्टि के सर्वेक्षण को वहन-योग्य बनाता है
संशोधन ही छोटी समष्टि के सर्वेक्षण को वहन-योग्य बनाता है: 385 के बजाय 278, यानी उसी घोषित सीमा के लिए सौ से ज़्यादा साक्षात्कारों की बचत। जैसे-जैसे नमूना समष्टि का बड़ा हिस्सा बनता है, यह बचत बढ़ती जाती है। 100 कर्मचारियों पर जवाब 80 आता है — जितने लोग हैं उससे ज़्यादा नमूना लिया ही नहीं जा सकता — और दस लाख कर्मचारियों पर संशोधन की क़ीमत एक व्यक्ति भर है, इसीलिए अज्ञात समष्टि के लिए 0 एक वाजिब डिफ़ॉल्ट है, कोई शॉर्टकट नहीं।
सीमाएँ
यह सूत्र जवाबों के नमूने का नाप तय करता है, निमंत्रणों की सूची का नहीं। अगर पूछे गए एक-तिहाई लोग जवाब ही न दें, तो 385 जवाबों का मतलब है लगभग 580 लोगों से पूछना, और अगर जवाब देने वाले लोग न देने वालों से व्यवस्थित रूप से अलग हों, तो इससे पैदा होने वाला पूर्वाग्रह किसी भी नमूने के आकार से ठीक नहीं होता — वह सिर्फ़ नमूना-त्रुटि को कुल त्रुटि से छोटा बना देता है। यह मॉडल यह भी मानता है कि हर जवाब समष्टि से एक स्वतंत्र निकासी है, जो समूहों में बँटी बनावटों पर लागू नहीं होता: 8 कक्षाओं से चुने गए 400 विद्यार्थियों के सर्वेक्षण का असरदार नमूना आकार 8 के कहीं ज़्यादा पास होता है, और इस पन्ने के आँकड़े को इस्तेमाल से पहले किसी डिज़ाइन-प्रभाव से गुणा करना चाहिए। यह अनुमान एक ही अनुपात के लिए है; माध्य के लिए मानक विचलन चाहिए, जो यह पन्ना नहीं लेता, और जिस सर्वेक्षण को उपसमूहों में बाँटा जाएगा उसके लिए नमूना सबसे छोटे उपसमूह के हिसाब से तय होना चाहिए, पूरे के हिसाब से नहीं। आख़िर में, दिए गए तीनों विश्वास स्तर परिपाटियाँ हैं, और उनमें से कोई भी उन कई तुलनाओं का हिसाब नहीं रखता जो असली विश्लेषण आम तौर पर करता है।
अक्सर पूछे जाने वाले सवाल
- मुझे कितने सर्वेक्षण जवाब चाहिए?
- परंपरागत ±5 प्रतिशत अंकों और 95% विश्वास पर 385 — और ±3 अंक चाहिए तो 1068। ये दो संख्याएँ छपे हुए सर्वेक्षणों के बड़े हिस्से को कवर कर लेती हैं, और ये यह मानकर चलती हैं कि समष्टि इतनी बड़ी है कि उसका आकार मायने नहीं रखता। अगर समष्टि इतनी छोटी है कि उसका बड़ा हिस्सा आप वाक़ई सर्वेक्षण में ले सकते हैं, तो उसका आकार भर दीजिए और संशोधन आँकड़ा नीचे ले आएगा: 1000 कर्मचारियों को 385 के बजाय 278 जवाब चाहिए, और 200 कर्मचारियों को 132। पहले त्रुटि की सीमा पर टिकिए, क्योंकि पाठक असल में वही संख्या पढ़ेगा।
- अपेक्षित अनुपात डिफ़ॉल्ट रूप से 50% क्यों होता है?
- क्योंकि p(1 − p) सबसे बड़ा p = 0.5 पर होता है, और नमूने का आकार उसके समानुपाती है, इसलिए 50% भरने पर वह सबसे बड़ा जवाब आता है जो कोई भी अनुपात माँग सकता है। यही इसे उस वक़्त सुरक्षित अनुमान बनाता है जब आपको सचमुच न पता हो: 60% पर लौटने वाले सर्वेक्षण की त्रुटि की सीमा आपकी योजना से थोड़ी बेहतर निकलेगी। ज़्यादा सटीक अनुमान का फ़ायदा मिलता है — p = 90% पर यह पद 0.25 से घटकर 0.09 रह जाता है, यानी उसी त्रुटि की सीमा के लिए नमूने का 36% काफ़ी है। 50% से अलग कोई मान तभी लीजिए जब उसके पीछे कोई बचाव हो, जैसे उसी सर्वेक्षण की पिछली बार की संख्या।
- सीमित समष्टि संशोधन करता क्या है?
- जब समष्टि इतनी छोटी हो कि उसमें से बिना वापस रखे निकालने पर अनिश्चितता नाप-तौल कर घट जाए, तब यह नमूने को छोटा कर देता है। इसका असर इस पर निर्भर है कि आप समष्टि का कितना हिस्सा ले रहे हैं: 10% पर संशोधन नमूने के कुछ प्रतिशत भर की क़ीमत है, 28% पर लगभग एक-चौथाई की, और 50% पर करीब एक-तिहाई की। समष्टि का आकार अज्ञात या बहुत बड़ा हो तो 0 भरिए, और असली संख्या तब भरिए जब समष्टि कुछ हज़ार से नीचे हो — यही वह ख़ाना है जो सबसे ज़्यादा बार किसी के पहले ही निकाल चुके जवाब को बदल देता है।
- मुझे कौन-सी त्रुटि की सीमा और कौन-सा विश्वास स्तर चुनना चाहिए?
- छपे हुए ज़्यादातर काम में 95% पर ±5 अंक डिफ़ॉल्ट है, जहाँ फ़ैसला किसी क़रीबी नतीजे पर टिका हो वहाँ ±3 अंक, और खोजबीन वाले काम में ±10 अंक जहाँ सिर्फ़ बड़ा फ़र्क़ मायने रखता है। विश्वास स्तर पर 95% परिपाटी है, और 99% सिर्फ़ एक-तिहाई चौड़े अंतराल के लिए लगभग 73% ज़्यादा नमूने की क़ीमत माँगता है। इनमें से कोई भी कसने से पहले देख लीजिए कि जवाब कितना महँगा पड़ता है: 99% विश्वास पर ±3 अंक के लिए 1843 जवाब चाहिए, जो डिफ़ॉल्ट का लगभग पाँच गुना है। अगर यह वहन से बाहर है तो चौड़ी सीमा छापिए, ऐसा नमूना जुटाने के बजाय जिसे आप पूरा न कर सकें।
- जवाब पूरे व्यक्ति तक ऊपर की ओर क्यों पूर्णांकित होता है?
- क्योंकि दशमलव वाला आँकड़ा सटीक अंकगणित है और पूरी संख्या ही जुटाई जा सकती है, और इन दोनों को एक-दूसरे में बदलने की दोनों परिपाटियाँ उलटी दिशाओं में जाती हैं। निकटतम तक पूर्णांकन 384.1459 को 384 तक नीचे ले आता, जो लक्षित त्रुटि की सीमा को बाल भर से चूक जाता — और लक्ष्य वही चीज़ है जो आपने माँगी थी। ऊपर की ओर पूर्णांकन यह गारंटी देता है कि सीमा पूरी हो या उससे बेहतर हो, इसकी क़ीमत ज़्यादा से ज़्यादा एक अतिरिक्त साक्षात्कार है, और यह उस तरीक़े से मेल भी खाता है जिसमें नमूने का आकार किसी प्रोटोकॉल में लिखा जाता है, जहाँ 385 एक वचन है और 384.1459 बीच का आँकड़ा।
- इस पन्ने पर नमूना आकारों की कोई तालिका क्यों नहीं है?
- क्योंकि यहाँ लोगों को जो तालिका चाहिए वह विश्वास स्तर बनाम त्रुटि की सीमा का जाल है, और वह जाल पैनल पहले ही निकाल रहा है। किसी तय 95% पर छपी तालिका उसी क्षण पैनल से टकरा जाती जब आप 99% पर जाते, और पन्ने का अपने ही आँकड़ों से टकराना तालिका न होने से बुरा है — पाठक को तय करना पड़ता कि दोनों में से किस संख्या पर भरोसा करे। दूसरी वजह यह है कि ऐसी तालिका को अनुपात भी चुनना पड़ता, और 50% तभी तक सही चुनाव है जब तक वह सुरक्षित डिफ़ॉल्ट है। विश्वास स्तर, त्रुटि की सीमा, अनुपात या समष्टि का आकार बदलिए और जवाब फिर से निकल आता है — यही उस तालिका की पूरी सामग्री है जिसे लोग खोज रहे होते हैं।
संदर्भ
- 3.1 Terminology — Introductory Statistics 2e (relative frequency approaching probability as a sample grows, which is the property that makes a target margin of error meaningful in advance) — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (the distribution of an estimate, which is what the margin of error is a quantile of) — National Institute of Standards and Technology (NIST)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the cumulative function the critical values come from; the same values, used in reverse here to size a sample rather than to bound an estimate) — National Institute of Standards and Technology (NIST)