द्विपद बंटन कैलकुलेटर
नतीजा
ठीक इतनी बार होने की प्रायिकता
- ज़्यादा से ज़्यादा इतनी बार होने की प्रायिकता
- 17.19%
- कम से कम इतनी बार होने की प्रायिकता
- 94.53%
- माध्य
- 5.00
- मानक विचलन
- 1.58
- प्रसरण
- 2.50
द्विपद बंटन कैलकुलेटर बार-बार दोहराए जाने वाले हाँ-या-ना प्रयोगों के बारे में सवाल का जवाब देता है: प्रयोगों की संख्या n और हर प्रयोग में एक ही सफलता की प्रायिकता p हो, तो ठीक k सफलताएँ मिलने की प्रायिकता क्या है? पैनल यह प्रायिकता, उसके दो संचयी रूप — ज़्यादा से ज़्यादा इतनी बार और कम से कम इतनी बार — तथा पूरे बंटन को बताने वाली तीन संख्याएँ छापता है: माध्य, प्रसरण और मानक विचलन। यह मॉडल उन्हीं हालातों का है जहाँ प्रयोगों की संख्या पहले से तय हो, हर प्रयोग में सफलता की प्रायिकता एक ही रहे, और प्रयोग एक-दूसरे से स्वतंत्र हों — सिक्के के उछालों से लेकर उन बैचों तक जहाँ हर नग की जाँच एक ही प्रायिकता से पास होती है। व्यवहार में लोगों को आम तौर पर संचयी पंक्तियाँ ही चाहिए, क्योंकि असली सवाल शायद ही कभी ठीक एक गिनती के बारे में होता है — वह किसी लक्ष्य तक पहुँचने या किसी सीमा के भीतर रहने के बारे में होता है।
फ़ॉर्मूला
P(X = k) = C(n, k) · p^k · (1 − p)^(n − k) जहाँ C(n, k) = n! / (k! (n − k)!)
- n
- प्रयोगों की संख्या, अधिकतम 1000 — एक ही हाँ-या-ना घटना की स्वतंत्र पुनरावृत्तियाँ। यह सीमा प्रदर्शन की है, गणित की नहीं: द्विपद बंटन इससे कहीं बड़े n पर भी पूरी तरह परिभाषित है, पर इस पेज की गिनतियाँ n के साथ बढ़ती हैं और अटका हुआ पेज मना करने वाले पेज से बुरा है
- k
- जिस सफलताओं की संख्या के बारे में आप पूछ रहे हैं। यह n से बड़ी नहीं हो सकती, क्योंकि प्रयोगों से ज़्यादा सफलताएँ कोई असंभावित नतीजा नहीं, एक असंभव माँग है
- p
- प्रति प्रयोग सफलता की प्रायिकता, 0 से 100 तक प्रतिशत में भरी गई। हर प्रयोग के लिए यही रहती है, और यही प्रयोगों को एक जैसा बनाती है
- C(n, k)
- द्विपद गुणांक: n प्रयोगों में k सफलताएँ कितने तरीक़ों से बैठाई जा सकती हैं। यही वजह है कि बीच की गिनतियाँ सबसे मुमकिन होती हैं — बीच के पास की गिनती सिरे की गिनती से कहीं ज़्यादा तरीक़ों से बन सकती है
- p^k · (1 − p)^(n − k)
- k सफलताओं और n − k असफलताओं के किसी एक ख़ास क्रम की प्रायिकता। तरीक़ों की संख्या से गुणा करने पर "एक क्रम" से "कोई भी क्रम" बन जाता है
- np
- सफलताओं की माध्य संख्या। प्रसरण np(1 − p) है और मानक विचलन उसका वर्गमूल — पैनल की आख़िरी तीन पंक्तियाँ यही बताती हैं
इसे तब उठाइए जब प्रयोग गिने जा रहे हों, नापे नहीं: बीस में से कितने नग जाँच में पास हुए, बारह फ़्री थ्रो में से कितने अंदर गए, या दस उछालों में कम से कम k सफलताएँ मिलने का मौक़ा क्या है। काम में संचयी पंक्तियाँ ही सबसे ज़्यादा आती हैं, क्योंकि लक्ष्य लगभग हमेशा एक सीमा होती है — गुणवत्ता द्वार पार करने के लिए कम से कम k, बजट के भीतर रहने के लिए ज़्यादा से ज़्यादा k — और सीमा को ठीक-गिनती वाली पंक्ति से पढ़ने का मतलब है गिनतियाँ हाथ से जोड़ना। दूसरा औज़ार तब चुनिए जब प्रयोगों की संख्या पहले से तय न हो, जब सफलता की प्रायिकता हर प्रयोग में बदलती हो, या जब प्रयोग एक-दूसरे को प्रभावित करते हों; असली आँकड़ों में तीसरी शर्त ही सबसे ज़्यादा टूटती है।
हल किए हुए उदाहरण
दस प्रयोग, तीन सफलताएँ, हर बार 50% मौक़ा
- दस प्रयोगों में तीन सफलताएँ बैठाने के C(10, 3) = 120 तरीक़े हैं
- किसी एक क्रम की प्रायिकता 0.5³ × 0.5⁷ = 1/1024 है
- 120 / 1024 = 0.1171875, यानी ठीक तीन सफलताएँ 11.72% बार मिलती हैं
- 0 से 3 तक की गिनतियाँ जोड़ने पर ज़्यादा से ज़्यादा 17.19% आता है; माध्य np = 10 × 0.5 = 5 है
इस उदाहरण का पूरा मुद्दा दोनों संचयी पंक्तियों के बीच का फ़ासला है: ज़्यादा से ज़्यादा 17.19% और कम से कम 94.53% के बीच 11.72% बचता है, और यही बचा हुआ टुकड़ा ठीक तीन की प्रायिकता है — वही गिनती जिसके बारे में पूछा गया था। इसी हिसाब से वह आम ग़लती पकड़ में आती है जो कम से कम को सौ में से ज़्यादा से ज़्यादा घटाकर पढ़ती है; वह यहाँ 82.81% कहती, जो ग़लत है। माध्य 5 और मानक विचलन 1.58 यह भी बताते हैं कि इस जमावट में 3 कोई हैरान करने वाली गिनती नहीं है: वह माध्य से कुछ ऊपर एक मानक विचलन के भीतर बैठती है।
बीस प्रयोग, हर बार 25% मौक़ा
- माध्य np = 20 × 0.25 = 5 सफलताएँ है
- प्रसरण np(1 − p) = 20 × 0.25 × 0.75 = 3.75 है, और उसका वर्गमूल करीब 1.94
- ठीक चार सफलताओं की प्रायिकता 18.97% है, और यहाँ सबसे मुमकिन अकेली गिनती यही है
- ज़्यादा से ज़्यादा चार 41.48% है, और कम से कम चार 77.48%
चार सफलताएँ माध्य के ठीक पास की गिनती भी हैं और सबसे मुमकिन अकेली गिनती भी, इसीलिए दोनों संचयी आँकड़े उसके इर्द-गिर्द इतने असमान बैठते हैं: पूरे बंटन का 41.48% सबसे मुमकिन गिनती पर या उससे नीचे है। यह असमानता सामान्य है और याद रखने लायक़ है — जब p छोटी हो तो बंटन की ऊपरी पूँछ लंबी हो जाती है, इसलिए माध्य पर या उससे नीचे की किसी भी गिनती के लिए "ज़्यादा से ज़्यादा इतनी बार" का मान अंदाज़े से बड़ा निकलता है। सारांश पंक्तियाँ यही देखने का औज़ार हैं: 5 के इर्द-गिर्द 1.94 का मानक विचलन 4 को सामान्य दायरे के भीतर रखता है, बिना कोई पद जोड़े।
सौ प्रयोग, एक भी सफलता नहीं, हर बार 2% मौक़ा
- k = 0 पर बैठाने का तरीक़ा ठीक एक है — कोई सफलता नहीं — इसलिए C(100, 0) = 1
- उसकी प्रायिकता 0.98¹⁰⁰ ≈ 0.1326 है, यानी एक भी सफलता न मिलना 13.26%
- ज़्यादा से ज़्यादा शून्य सफलताएँ वही एक घटना है, इसलिए वह पंक्ति इससे बिलकुल मिलती है
- कम से कम शून्य सफलताएँ में हर मुमकिन नतीजा शामिल है — हर नतीजे में शून्य या उससे ज़्यादा सफलताएँ होती हैं — इसलिए वह 100% है
यही वह मामला है जो कम से कम वाली पंक्ति को पूरी तरह तय कर देता है। कम से कम शून्य सफलताएँ कोई निरर्थक किनारा नहीं बल्कि निश्चितता है, इसलिए 100% यहाँ सही जवाब है, कोई भराव नहीं। तीनों पंक्तियाँ एक साथ पढ़िए तो off-by-one दिखने लगता है: ज़्यादा से ज़्यादा 13.26% और कम से कम 100% का जोड़ 100% से ऊपर जाता है, क्योंकि ठीक शून्य वाली गिनती दोनों के भीतर बैठी है — और दोनों जितना ओवरलैप करती हैं, वह ठीक यही 13.26% है। इस उदाहरण का दूसरा आधा हिस्सा माध्य है: सौ में दो सफलताएँ अपेक्षित होना भरोसेमंद लगता है, फिर भी एक भी न मिलना आठ में से करीब एक बार होता है।
हज़ार प्रयोग, हर बार 50% मौक़ा
- माध्य 1000 × 0.5 = 500 सफलताएँ है और प्रसरण 250, इसलिए मानक विचलन करीब 15.81
- ठीक 500 सफलताएँ — सबसे मुमकिन अकेली गिनती — की प्रायिकता 2.52% है
- ज़्यादा से ज़्यादा 500 भी 51.26% और कम से कम 500 भी 51.26%, क्योंकि 500 बीच में बैठती है
- यहाँ दोनों संचयी आँकड़े बराबर हैं, और ऐसा केवल माध्य पर होता है
यहाँ से दो बातें उठाने लायक़ हैं। पहली, सबसे मुमकिन अकेली गिनती भी कोई मुमकिन घटना नहीं होती: 500 इस बंटन का शिखर है और फिर भी वह करीब चालीस में एक बार ही आता है, क्योंकि बिखरने के लिए हज़ार गिनतियाँ मौजूद हैं। दूसरी, दोनों संचयी पंक्तियाँ ठीक 51.26% पर बराबर होती हैं — यह अपने आप को जाँचने का काम का तरीक़ा है, क्योंकि माध्य पर बंटन सममित होता है और बराबरी से किसी भी हद तक हटना बताता है कि गिनती केंद्र से खिसक गई है। यह भी देखिए कि यहाँ 2.52% की प्रायिकता सैकड़ों अंकों वाले द्विपद गुणांकों से निकलती है — इसीलिए यह औज़ार प्रयोगों की संख्या पर सीमा लगाता है, बहादुरी दिखाने की कोशिश नहीं करता।
सीमाएँ
द्विपद मॉडल तीन शर्तों पर टिका है, और इनमें से कोई एक टूटे तो संख्याएँ विश्वसनीय दिखती रहती हैं और ग़लत हो जाती हैं। प्रयोगों की संख्या पहले से तय होनी चाहिए, चलते-चलते तय नहीं होनी चाहिए; सफलता की प्रायिकता हर प्रयोग में एक ही होनी चाहिए; और प्रयोगों को एक-दूसरे से स्वतंत्र होना चाहिए — असली आँकड़ों में तीसरी शर्त ही सबसे ज़्यादा टूटती है, क्योंकि एक ही बैच, एक ही व्यक्ति या एक ही दिन के नमूने साथ-साथ चलते हैं। जब सफलताएँ झुंड में आती हैं तो असली बिखराव इस पेज के बताए मुक़ाबले चौड़ा होता है। दो और सीमाएँ बताने लायक़ हैं। प्रयोगों की संख्या 1000 पर रोकी गई है, जो प्रदर्शन की सीमा है, गणित की नहीं: मॉडल इससे बहुत आगे तक परिभाषित है, पर गिनतियाँ प्रयोगों की संख्या के साथ बढ़ती हैं और अटका हुआ पेज किसी के काम का नहीं। और इस पेज पर गिनती के हिसाब से प्रायिकताओं की कोई तालिका नहीं है: जो तालिका लोग चाहते हैं वह हर मुमकिन संख्या के लिए एक पंक्ति माँगती है, जो आपके भरे हुए प्रयोगों की संख्या और प्रायिकता पर निर्भर करती है, और यहाँ की संदर्भ तालिका उन इनपुट को देख ही नहीं सकती — पैनल की तीन पंक्तियाँ आपकी चुनी हुई संख्याओं के लिए उसी तालिका का आकार बताती हैं।
अक्सर पूछे जाने वाले सवाल
- कम से कम k, सौ में से ज़्यादा से ज़्यादा k क्यों नहीं है?
- क्योंकि ये दोनों घटनाएँ एक-दूसरे की पूरक नहीं हैं। ज़्यादा से ज़्यादा k का मतलब शून्य से k तक, और कम से कम k का मतलब k से n तक — ठीक k वाली गिनती दोनों के भीतर बैठी है, इसलिए एक को 100% से घटाने पर वही साझा टुकड़ा छूट जाता है, जो ठीक वही प्रायिकता है जिसके बारे में आपने पूछा था। कम से कम k का पूरक चाहिए तो ज़्यादा से ज़्यादा k − 1 वाली पंक्ति देखिए, या तीनों पंक्तियाँ एक साथ पढ़िए: ठीक k हमेशा बाक़ी दो के बीच का फ़ासला होती है, और वह फ़ासला तीनों के लिए एक अच्छी जाँच है।
- क्या सफलता की प्रायिकता 0% या 100% हो सकती है?
- हाँ, और ये दोनों किनारे नहीं बल्कि अर्थपूर्ण हालात हैं। 0% मौक़े का मतलब है कि घटना कभी नहीं होती, इसलिए सफलताओं की संख्या निश्चित रूप से 0; 100% का मतलब है कि वह हमेशा होती है, इसलिए संख्या निश्चित रूप से n। पैनल बनने वाली 0% और 100% पंक्तियाँ सीधे दिखा देता है। ऐसा लगे कि किसी छोटी-पर-मुमकिन गिनती पर सपाट 0% आ रहा है, तो प्रायिकता वाला ख़ाना जाँचिए — जहाँ 10 लिखना था वहाँ 0 लिखा जाना बिलकुल यही नतीजा देता है।
- हर संख्या की प्रायिकता दिखाने वाली कोई तालिका क्यों नहीं है?
- क्योंकि ऐसी तालिका आपके भरे हुए प्रयोगों की संख्या और सफलता की प्रायिकता पर निर्भर करती है, और इस पेज की संदर्भ तालिका उन इनपुट को देख ही नहीं सकती — वह स्थिर संख्याओं से बनती है, इसलिए वह किसी और जमावट के आँकड़े ऐसे शीर्षक के नीचे दिखाती जो आपकी जमावट जैसा दिखता है। इसके बजाय नतीजे के पैनल की तीन पंक्तियाँ उस तालिका का आकार उसी गिनती पर बताती हैं जिसके बारे में आपने पूछा: ठीक गिनती, उससे नीचे का सब, और उससे ऊपर का सब। पूरा बंटन देखना हो तो सफलताओं की संख्या बदलिए और ठीक वाली पंक्ति फिर पढ़िए — वही मान एक-एक पंक्ति में वह तालिका हैं।
- माध्य मुझे वह क्या बताता है जो प्रायिकता नहीं बताती?
- वह बताता है कि बंटन कहाँ बैठा है, और यही किसी गिनती को पढ़ने लायक़ बनाता है। 5 सफलताओं के माध्य और 1.58 के मानक विचलन के साथ 3 एक सामान्य नतीजा है, जबकि वही 3 अगर 12 के माध्य के सामने रखा जाए तो बहुत दूर पड़ता है। माध्य np है, प्रसरण np(1 − p) है, और मानक विचलन उसका वर्गमूल — ये तीन सारांश पंक्तियाँ बंटन को एक-एक प्रायिकता के बजाय उसके केंद्र और उसके बिखराव से बताती हैं।
- अगर मैं प्रयोगों से ज़्यादा सफलताएँ माँगूँ तो क्या होगा?
- उसे 0% कहकर जवाब देने के बजाय अस्वीकार किया जाता है। प्रयोगों से ज़्यादा सफलताएँ कोई असंभावित नतीजा नहीं है — वह नतीजा है ही नहीं, और 0% छापना यह सुझाव देता कि मॉडल ने उस पर विचार करके उसे नामुमकिन ठहराया। पैनल त्रुटि दिखाता है, और यही बात 1000 से ऊपर की प्रयोग-संख्या पर भी लागू होती है, जिसे गणित रुक जाने की वजह से नहीं बल्कि प्रदर्शन की सीमा की वजह से मना किया जाता है।
- क्या प्रयोगों का स्वतंत्र होना सचमुच ज़रूरी है?
- ज़रूरी है, और असली आँकड़ों में यही शर्त सबसे ज़्यादा टूटती है। अगर सफलताएँ झुंड में आती हैं — एक ही उत्पादन बैच के नग, एक ही खिलाड़ी के एक ही दिन के शॉट, एक ही क्लिनिक के मरीज़ — तो प्रयोग एक-दूसरे के बारे में जानकारी रखने लगते हैं, और गिनती का असली बिखराव द्विपद के बताए मुक़ाबले चौड़ा होता है। झुंड बनने पर माध्य मोटे तौर पर ठीक रहता है, जबकि मानक विचलन और पूँछ की प्रायिकताएँ नहीं रहतीं, इसलिए तीन सारांश पंक्तियों में सबसे पहले उन्हीं पर शक कीजिए। जब पता हो कि प्रयोग झुंड बनाते हैं, तब अतिरिक्त बिखराव वाला मॉडल ही सही औज़ार है।
संदर्भ
- 1.3.6.6.18. Binomial Distribution — e-Handbook of Statistical Methods (the binomial probability function, its mean np and variance np(1 − p), and the assumptions the model rests on) — National Institute of Standards and Technology (NIST)
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, and the cumulative form used by the at most and at least rows) — OpenStax, Rice University
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)