मुख्य सामग्री पर जाएँ
CalcMax

नमूना आकार कैलकुलेटर

सीमा: 0 – 100

सीमा: 0 – 100

कम से कम: 0

नतीजा

385

ज़रूरी नमूने का आकार

क्रांतिक मान
1.9600

नमूना आकार कैलकुलेटर उस सवाल का जवाब देता है जो सर्वेक्षण से पहले आता है: जिस त्रुटि की सीमा पर आप राज़ी हैं, उस तक पहुँचने के लिए कितने जवाब चाहिए? इसे एक विश्वास स्तर, एक लक्षित त्रुटि की सीमा और अंदाज़े से एक अनुपात दीजिए, और यह वह सबसे छोटा नमूना लौटाता है जो उस लक्ष्य को पूरा करता है। सूत्र वही त्रुटि की सीमा का उलटा रूप है — वही संबंध जिसे विश्वास अंतराल वाला पन्ना दूसरी दिशा में लगाता है, यहाँ चौड़ाई के बजाय नमूने के लिए हल किया हुआ। जब सर्वेक्षण किसी छोटी समष्टि को कवर करता है, तब सीमित समष्टि संशोधन जवाब को छोटा कर देता है, और किसी एक कारख़ाने या एक स्कूल के लिए वह उसे बहुत छोटा कर देता है। यह जानना भी ज़रूरी है कि यह गिनती तय करती है कि कितने जवाब चाहिए, यह नहीं कि कितने लोगों से पूछना है।

फ़ॉर्मूला

n₀ = z² · p (1 − p) / e² छोटी समष्टि: n = n₀ / ( 1 + (n₀ − 1) / N )

z
विश्वास स्तर का क्रांतिक मान — 95% पर 1.9600, 90% पर 1.6449 और 99% पर 2.5758। यह अपनी अलग पंक्ति में इसलिए छपता है क्योंकि सूत्र में यही एक संख्या है जो समष्टि के बारे में आपके अनुमानों से नहीं, विश्वास स्तर से आती है
p
वह अनुपात जिसके मिलने की उम्मीद है, दशमलव में। चारों में यही एक इनपुट अंदाज़ा है, और यह p(1 − p) के रूप में आता है, जो p = 0.5 पर सबसे बड़ा होता है — इसलिए 50% भरना वह अनुमान है जो सबसे बड़ा और सबसे सुरक्षित नमूना देता है
e
त्रुटि की सीमा, दशमलव में — वह आधी चौड़ाई जिसे आप स्वीकार करते हैं, उसी इकाई में जिसमें अनुपात है। हर में यह वर्गित होती है, इसीलिए इसे आधा करने पर नमूना लगभग चार गुना हो जाता है
n₀
इतनी बड़ी समष्टि के लिए नमूने का आकार जहाँ समष्टि का आकार मायने नहीं रखता। समष्टि अज्ञात हो तो जवाब यही है, और अज्ञात न हो तो यह संशोधन का इनपुट है, आख़िरी जवाब नहीं
N
समष्टि का आकार, जिसे अज्ञात या व्यवहार में असीमित होने पर 0 भरा जाता है। संशोधन n₀ को n₀/N से बड़ी किसी संख्या से भाग देता है, इसलिए संशोधित नमूना हमेशा N से नीचे ही आता है — जितने लोग मौजूद हैं उससे ज़्यादा माँगना इस सूत्र से हो ही नहीं सकता

इसे आँकड़े जुटाने से पहले लगाइए, जब भी नमूने की क़ीमत असली हो — हर जवाब पर कुछ देने वाला सर्वेक्षण, हर नमूने पर दाम लेने वाला प्रयोगशाला मापन, या भर्ती के लक्ष्य वाला क्लिनिकल अध्ययन। फ़ैसलों का क्रम यह है: पहले वह त्रुटि की सीमा तय कीजिए जिसके साथ जी सकते हैं, फिर विश्वास स्तर, फिर अनुपात का अंदाज़ा, और फिर नमूने का आकार पढ़िए। इनमें सिर्फ़ पहला अध्ययन के बारे में आपका निर्णय है; बाक़ी दो या तो परिपाटी हैं या अंदाज़े। जवाब अगर वहन से बाहर हो तो ईमानदार क़दम यही है कि त्रुटि की सीमा चौड़ी कर दी जाए और रिपोर्ट में यह लिख दिया जाए, क्योंकि जिस त्रुटि की सीमा का ख़र्च न उठाया जा सके वह लक्ष्य नहीं है। समष्टि का आकार तब भरिए जब वह सचमुच छोटी हो — कुछ हज़ार से नीचे — क्योंकि वहाँ संशोधन ठोस होता है और उसे नज़रअंदाज़ करने का मतलब है अध्ययन की ज़रूरत से कहीं ज़्यादा लोगों को जुटाना।

हल किए हुए उदाहरण

  1. 95% विश्वास और ±5 अंकों पर राष्ट्रीय सर्वेक्षण

    1. 95% विश्वास पर क्रांतिक मान: 1.96
    2. p = 0.5 पर गुणनफल p(1 − p) = 0.25, जो उसका सबसे बड़ा संभव मान है
    3. n₀ = 1.96² × 0.25 / 0.05² = 3.8416 × 0.25 / 0.0025 = 384.1459
    4. पूरे व्यक्ति तक ऊपर की ओर पूर्णांकन: 385 जवाब
    5. यानी अगर लोगों से पूछने की संख्या चाहिए तो यह 385 नहीं, उससे ज़्यादा होगी — यह गिनती जवाबों की है

    385 वही संख्या है जिस पर वह जाना-पहचाना दावा टिका है कि लगभग हज़ार लोगों का सर्वेक्षण तीन अंकों के भीतर सही होता है — सीमा ±3 तक कसिए और जवाब 1068 बन जाता है, जहाँ से वह आँकड़ा आता है। समष्टि का आकार 0 पर छोड़ा गया क्योंकि राष्ट्रीय सर्वेक्षण देश का नगण्य अंश होता है, और उस अनुपात पर संशोधन जवाब को एक व्यक्ति से भी कम बदलता।

  2. वही सर्वेक्षण, ज़्यादा कसी ±3 अंकों की सीमा के साथ

    1. क्रांतिक मान 1.96 पर वही रहा, क्योंकि विश्वास स्तर नहीं बदला
    2. n₀ = 1.96² × 0.25 / 0.03² = 0.9604 / 0.0009 = 1067.0719
    3. ऊपर की ओर पूर्णांकन: 1068 जवाब
    4. 385 से तुलना कीजिए: सीमा 1.667 के गुणक से घटी और नमूना 2.78 के गुणक से बढ़ा, जो 1.667² है
    5. यानी सटीकता चुकता दर से ख़रीदी जाती है, सीधे अनुपात में नहीं

    सटीकता चुकता दर से ख़रीदी जाती है। ±5 से ±3 अंकों तक जाना काम में 67% की बढ़ोतरी नहीं, 178% की बढ़ोतरी है, क्योंकि त्रुटि की सीमा हर में वर्गित होती है। व्यावहारिक नतीजा यह है कि सस्ते में कितना सटीक सर्वेक्षण हो सकता है, इसकी एक सीमा होती है, और ±3 अंकों से कसी सीमा का ऐलान हज़ारों के नमूने का मतलब रखता है — और ठीक उसी दायरे में जवाब न देने का झुकाव उस नमूना-त्रुटि से ज़्यादा मायने रखने लगता है जिसे यह सूत्र क़ाबू में करता है।

  3. 1000 कर्मचारियों वाली कंपनी का स्टाफ़ सर्वेक्षण

    1. बिना संशोधन वाला आँकड़ा अब भी 384.1459 है, क्योंकि उसे समष्टि के बारे में अभी पता नहीं
    2. संशोधन: 384.1459 / ( 1 + 383.1459 / 1000 ) = 384.1459 / 1.3831459 = 277.73
    3. ऊपर की ओर पूर्णांकन: 278 कर्मचारी
    4. यह कुल कर्मचारियों का 28% है, उस 38% के बजाय जो बिना संशोधन वाला आँकड़ा बताता
    5. यानी संशोधन वही है जो छोटी समष्टि के सर्वेक्षण को वहन-योग्य बनाता है

    संशोधन ही छोटी समष्टि के सर्वेक्षण को वहन-योग्य बनाता है: 385 के बजाय 278, यानी उसी घोषित सीमा के लिए सौ से ज़्यादा साक्षात्कारों की बचत। जैसे-जैसे नमूना समष्टि का बड़ा हिस्सा बनता है, यह बचत बढ़ती जाती है। 100 कर्मचारियों पर जवाब 80 आता है — जितने लोग हैं उससे ज़्यादा नमूना लिया ही नहीं जा सकता — और दस लाख कर्मचारियों पर संशोधन की क़ीमत एक व्यक्ति भर है, इसीलिए अज्ञात समष्टि के लिए 0 एक वाजिब डिफ़ॉल्ट है, कोई शॉर्टकट नहीं।

सीमाएँ

यह सूत्र जवाबों के नमूने का नाप तय करता है, निमंत्रणों की सूची का नहीं। अगर पूछे गए एक-तिहाई लोग जवाब ही न दें, तो 385 जवाबों का मतलब है लगभग 580 लोगों से पूछना, और अगर जवाब देने वाले लोग न देने वालों से व्यवस्थित रूप से अलग हों, तो इससे पैदा होने वाला पूर्वाग्रह किसी भी नमूने के आकार से ठीक नहीं होता — वह सिर्फ़ नमूना-त्रुटि को कुल त्रुटि से छोटा बना देता है। यह मॉडल यह भी मानता है कि हर जवाब समष्टि से एक स्वतंत्र निकासी है, जो समूहों में बँटी बनावटों पर लागू नहीं होता: 8 कक्षाओं से चुने गए 400 विद्यार्थियों के सर्वेक्षण का असरदार नमूना आकार 8 के कहीं ज़्यादा पास होता है, और इस पन्ने के आँकड़े को इस्तेमाल से पहले किसी डिज़ाइन-प्रभाव से गुणा करना चाहिए। यह अनुमान एक ही अनुपात के लिए है; माध्य के लिए मानक विचलन चाहिए, जो यह पन्ना नहीं लेता, और जिस सर्वेक्षण को उपसमूहों में बाँटा जाएगा उसके लिए नमूना सबसे छोटे उपसमूह के हिसाब से तय होना चाहिए, पूरे के हिसाब से नहीं। आख़िर में, दिए गए तीनों विश्वास स्तर परिपाटियाँ हैं, और उनमें से कोई भी उन कई तुलनाओं का हिसाब नहीं रखता जो असली विश्लेषण आम तौर पर करता है।

अक्सर पूछे जाने वाले सवाल

मुझे कितने सर्वेक्षण जवाब चाहिए?
परंपरागत ±5 प्रतिशत अंकों और 95% विश्वास पर 385 — और ±3 अंक चाहिए तो 1068। ये दो संख्याएँ छपे हुए सर्वेक्षणों के बड़े हिस्से को कवर कर लेती हैं, और ये यह मानकर चलती हैं कि समष्टि इतनी बड़ी है कि उसका आकार मायने नहीं रखता। अगर समष्टि इतनी छोटी है कि उसका बड़ा हिस्सा आप वाक़ई सर्वेक्षण में ले सकते हैं, तो उसका आकार भर दीजिए और संशोधन आँकड़ा नीचे ले आएगा: 1000 कर्मचारियों को 385 के बजाय 278 जवाब चाहिए, और 200 कर्मचारियों को 132। पहले त्रुटि की सीमा पर टिकिए, क्योंकि पाठक असल में वही संख्या पढ़ेगा।
अपेक्षित अनुपात डिफ़ॉल्ट रूप से 50% क्यों होता है?
क्योंकि p(1 − p) सबसे बड़ा p = 0.5 पर होता है, और नमूने का आकार उसके समानुपाती है, इसलिए 50% भरने पर वह सबसे बड़ा जवाब आता है जो कोई भी अनुपात माँग सकता है। यही इसे उस वक़्त सुरक्षित अनुमान बनाता है जब आपको सचमुच न पता हो: 60% पर लौटने वाले सर्वेक्षण की त्रुटि की सीमा आपकी योजना से थोड़ी बेहतर निकलेगी। ज़्यादा सटीक अनुमान का फ़ायदा मिलता है — p = 90% पर यह पद 0.25 से घटकर 0.09 रह जाता है, यानी उसी त्रुटि की सीमा के लिए नमूने का 36% काफ़ी है। 50% से अलग कोई मान तभी लीजिए जब उसके पीछे कोई बचाव हो, जैसे उसी सर्वेक्षण की पिछली बार की संख्या।
सीमित समष्टि संशोधन करता क्या है?
जब समष्टि इतनी छोटी हो कि उसमें से बिना वापस रखे निकालने पर अनिश्चितता नाप-तौल कर घट जाए, तब यह नमूने को छोटा कर देता है। इसका असर इस पर निर्भर है कि आप समष्टि का कितना हिस्सा ले रहे हैं: 10% पर संशोधन नमूने के कुछ प्रतिशत भर की क़ीमत है, 28% पर लगभग एक-चौथाई की, और 50% पर करीब एक-तिहाई की। समष्टि का आकार अज्ञात या बहुत बड़ा हो तो 0 भरिए, और असली संख्या तब भरिए जब समष्टि कुछ हज़ार से नीचे हो — यही वह ख़ाना है जो सबसे ज़्यादा बार किसी के पहले ही निकाल चुके जवाब को बदल देता है।
मुझे कौन-सी त्रुटि की सीमा और कौन-सा विश्वास स्तर चुनना चाहिए?
छपे हुए ज़्यादातर काम में 95% पर ±5 अंक डिफ़ॉल्ट है, जहाँ फ़ैसला किसी क़रीबी नतीजे पर टिका हो वहाँ ±3 अंक, और खोजबीन वाले काम में ±10 अंक जहाँ सिर्फ़ बड़ा फ़र्क़ मायने रखता है। विश्वास स्तर पर 95% परिपाटी है, और 99% सिर्फ़ एक-तिहाई चौड़े अंतराल के लिए लगभग 73% ज़्यादा नमूने की क़ीमत माँगता है। इनमें से कोई भी कसने से पहले देख लीजिए कि जवाब कितना महँगा पड़ता है: 99% विश्वास पर ±3 अंक के लिए 1843 जवाब चाहिए, जो डिफ़ॉल्ट का लगभग पाँच गुना है। अगर यह वहन से बाहर है तो चौड़ी सीमा छापिए, ऐसा नमूना जुटाने के बजाय जिसे आप पूरा न कर सकें।
जवाब पूरे व्यक्ति तक ऊपर की ओर क्यों पूर्णांकित होता है?
क्योंकि दशमलव वाला आँकड़ा सटीक अंकगणित है और पूरी संख्या ही जुटाई जा सकती है, और इन दोनों को एक-दूसरे में बदलने की दोनों परिपाटियाँ उलटी दिशाओं में जाती हैं। निकटतम तक पूर्णांकन 384.1459 को 384 तक नीचे ले आता, जो लक्षित त्रुटि की सीमा को बाल भर से चूक जाता — और लक्ष्य वही चीज़ है जो आपने माँगी थी। ऊपर की ओर पूर्णांकन यह गारंटी देता है कि सीमा पूरी हो या उससे बेहतर हो, इसकी क़ीमत ज़्यादा से ज़्यादा एक अतिरिक्त साक्षात्कार है, और यह उस तरीक़े से मेल भी खाता है जिसमें नमूने का आकार किसी प्रोटोकॉल में लिखा जाता है, जहाँ 385 एक वचन है और 384.1459 बीच का आँकड़ा।
इस पन्ने पर नमूना आकारों की कोई तालिका क्यों नहीं है?
क्योंकि यहाँ लोगों को जो तालिका चाहिए वह विश्वास स्तर बनाम त्रुटि की सीमा का जाल है, और वह जाल पैनल पहले ही निकाल रहा है। किसी तय 95% पर छपी तालिका उसी क्षण पैनल से टकरा जाती जब आप 99% पर जाते, और पन्ने का अपने ही आँकड़ों से टकराना तालिका न होने से बुरा है — पाठक को तय करना पड़ता कि दोनों में से किस संख्या पर भरोसा करे। दूसरी वजह यह है कि ऐसी तालिका को अनुपात भी चुनना पड़ता, और 50% तभी तक सही चुनाव है जब तक वह सुरक्षित डिफ़ॉल्ट है। विश्वास स्तर, त्रुटि की सीमा, अनुपात या समष्टि का आकार बदलिए और जवाब फिर से निकल आता है — यही उस तालिका की पूरी सामग्री है जिसे लोग खोज रहे होते हैं।

संदर्भ

इससे जुड़े कैलकुलेटर