पॉइसन बंटन कैलकुलेटर
नतीजा
ठीक इतनी बार होने की प्रायिकता
- ज़्यादा से ज़्यादा इतनी बार होने की प्रायिकता
- 43.35%
- कम से कम इतनी बार होने की प्रायिकता
- 76.19%
- माध्य
- 4.00
- प्रसरण
- 4.00
- मानक विचलन
- 2.00
पॉइसन बंटन कैलकुलेटर उस सवाल का जवाब देता है जिसमें घटनाएँ किसी एकरस औसत दर से आती हैं: किसी अंतराल में ठीक k बार होने का मौक़ा क्या है? इस नमूने का एक ही पैरामीटर होता है, जिसे आम तौर पर लैम्ब्डा लिखा जाता है और जो घटनाओं की औसत दर को अंतराल की लंबाई से गुणा करके मिलता है — यानी उस खिड़की में जितनी घटनाएँ अपेक्षित हैं जिसके बारे में आप पूछ रहे हैं। पेज ठीक k बार होने का मौक़ा, और उसके साथ दो संचयी रूप — ज़्यादा से ज़्यादा k और कम से कम k — तथा पूरे बंटन को समेटने वाली तीन संख्याएँ छापता है: माध्य, प्रसरण और मानक विचलन। यह नमूना उन दुर्लभ घटनाओं की धारा का बखान करता है जो एक-दूसरे को प्रभावित नहीं करतीं — सहायता डेस्क पर आती कॉलें, पुर्ज़ों के किसी बैच में ख़राबियाँ, सड़क के किसी हिस्से पर दुर्घटनाएँ, किसी तय गिनती-खिड़की में रेडियोऐक्टिव क्षय। इसकी पहचान यह है कि माध्य और प्रसरण एक ही संख्या होते हैं — दोनों λ — इसलिए जिस गिनती का फैलाव उसके औसत से बहुत ज़्यादा या बहुत कम हो, वह इस प्रक्रिया से नहीं निकली, और मानक विचलन सीधे अपेक्षित गिनती का वर्गमूल होता है।
फ़ॉर्मूला
P(X = k) = e^(−λ) · λ^k / k!, जहाँ λ = दर × अंतराल की लंबाई, और प्रसरण भी λ के बराबर
- λ
- अंतराल में अपेक्षित घटनाओं की संख्या — दर को खिड़की की लंबाई से गुणा करने पर जो मिलता है, और यही इस बंटन का अकेला पैरामीटर है। इस पेज की हर चीज़ इसी का फलन है, और इसीलिए दर तथा अंतराल एक संख्या के बजाय अलग-अलग पूछे जाते हैं
- k
- जिन घटनाओं के बारे में आप पूछ रहे हैं उनकी संख्या। यह 0 से शुरू होने वाली पूरी गिनती है, और 0 एक असली जवाब है, ख़ाली नहीं: जब तक लैम्ब्डा क़रीब 0.7 से नीचे रहे, "कुछ भी नहीं हुआ" सबसे संभावित नतीजा होता है
- e^(−λ)
- कुछ भी न होने का भार, गिनती जोड़ने से पहले। इसी वजह से लैम्ब्डा बढ़ने पर पूरा बंटन सिकुड़ता जाता है: अपेक्षित गिनती जितनी बड़ी, कुछ भी न दिखने का मौक़ा उतना ही छोटा
- λ^k / k!
- वह हिस्सा जो k के साथ बढ़ता है और फिर गिरता है: माध्य की k-वीं घात बटा गिनती का क्रमगुणित। इसका शिखर k = λ पर बैठता है, और बंटन का सबसे ज़्यादा द्रव्यमान वहीं ख़र्च होता है
- mean = variance = λ
- वह गुण जिससे यह बंटन पहचाना जाता है। अपेक्षित गिनती और उसका प्रसरण एक ही संख्या हैं, इसलिए मानक विचलन माध्य का वर्गमूल है — चार घटनाओं के माध्य पर √4 = 2, और हज़ार के माध्य पर √1000 ≈ 31.6
इसे तब लगाइए जब आप गिन रहे हों कि हर अंतराल में कितनी घटनाएँ आती हैं और वे आगमन आपस में स्वतंत्र हैं: एक घंटे में कितनी कॉलें, कपड़े के एक वर्ग मीटर में कितनी ख़राबियाँ, तय खिड़की में कितने कण। दो शर्तें सबसे ज़्यादा वज़न रखती हैं। घटनाएँ अपने मौक़ों के मुक़ाबले दुर्लभ होनी चाहिए — इतनी तेज़ दर कि गिनती असल में किसी और चीज़ से बँध जाए, पॉइसन रह ही नहीं जाती — और वे झुंड में नहीं आनी चाहिए, क्योंकि एक ही कारण से आया झुंड उस स्वतंत्रता को तोड़ देता है जिस पर यह बंटन टिका है। जब मौक़ों की संख्या तय और गिनी हुई हो तो द्विपद बंटन उठाइए, क्योंकि पॉइसन की गिनती पर कोई ऊपरी छत नहीं होती जबकि द्विपद अपने प्रयोगों से आगे नहीं जा सकता; और लैम्ब्डा बड़ा होते ही सामान्य सन्निकटन उठाइए, जहाँ दोनों क़रीब-क़रीब मेल खाते हैं और मानक विचलन की पहचानी हुई पट्टियाँ पढ़ने लायक़ हो जाती हैं। माध्य का प्रसरण के बराबर होना भी सबसे तेज़ जाँच है: गिनतियों के किसी समूह का प्रसरण उसके माध्य से भाग दीजिए और अगर अनुपात एक से बहुत दूर निकले, तो प्रक्रिया का फैलाव ज़रूरत से ज़्यादा या कम है और यह नमूना उसके लिए ग़लत आकार का है।
हल किए हुए उदाहरण
चार घटनाएँ प्रति घंटा, सवाल तीन के बारे में
- दर 4 प्रति घंटा है और अंतराल 1 घंटे का, इसलिए लैम्ब्डा 4 है
- P(X = 3) = e⁻⁴ × 4³ / 3! = 0.018316 × 64 / 6 = 0.1954, यानी 19.54%
- 0 से 3 तक की गिनतियाँ जोड़ने पर ज़्यादा से ज़्यादा 43.35% बनता है; 3 से ऊपर का बाक़ी द्रव्यमान कम से कम 76.19% देता है
- माध्य लैम्ब्डा = 4 है और प्रसरण भी, जिससे मानक विचलन √4 = 2 निकलता है
यहाँ दोनों संचयी पंक्तियाँ एक-दूसरे पर चढ़ती हैं और यह ग़लती नहीं है: 43.35% और 76.19% जुड़कर 119.54% बनते हैं, और 100% से ऊपर का यही अतिरिक्त हिस्सा ठीक तीन घटनाओं का 19.54% है, जो दोनों पंक्तियों में बैठा है। यह वही चेतावनी है जो द्विपद की गिनती के साथ भी लगती है, और यह आम ग़लती पकड़ती है कि कम से कम को एक घटाकर ज़्यादा से ज़्यादा समझ लिया जाए — वह यहाँ 56.65% कहता। यह भी देखिए कि औसत चार होने पर तीन घटनाएँ कुछ असाधारण नहीं हैं: वे माध्य से आधे मानक विचलन नीचे बैठती हैं।
बंटन का केंद्र
- तीन के बजाय चार घटनाओं के बारे में पूछिए: P(X = 4) = e⁻⁴ × 4⁴ / 4! = 0.018316 × 256 / 24 = 0.1954
- ठीक होने का मौक़ा वही 19.54% है जो तीन घटनाओं का था, क्योंकि बंटन का शिखर k = 4 = लैम्ब्डा पर बैठता है और उसके दोनों ओर की गिनतियाँ बराबर संभावित हैं
- ज़्यादा से ज़्यादा चार 62.88% है और कम से कम चार 56.65%
- माध्य, प्रसरण और मानक विचलन नहीं बदलते, क्योंकि वे सिर्फ़ लैम्ब्डा पर निर्भर हैं
दो गिनतियों का एक ही मौक़ा होना सबसे साफ़ दिखने वाला संकेत है कि बंटन लैम्ब्डा पर केंद्रित है: चार घटनाओं के माध्य पर तीन देखना और चार देखना बराबर संभावित हैं, और बाक़ी हर गिनती उनसे कम। जमा होती पंक्तियाँ यहाँ भी सममित नहीं हैं — 62.88% बनाम 56.65% — क्योंकि ज़्यादा से ज़्यादा वाली पंक्ति k = 4 को पूरा समेटती है और कम से कम वाली भी, और शिखर के नीचे बंटन उसके ऊपर से पतला है।
वही दर, तीन घंटे के अंतराल पर
- दर वही 4 प्रति घंटा है, पर अंतराल अब 3 घंटे का है, इसलिए लैम्ब्डा = 4 × 3 = 12
- P(X = 3) = e⁻¹² × 12³ / 3! = 0.0000061 × 1728 / 6 = 0.0018, यानी 0.18%
- ज़्यादा से ज़्यादा तीन 0.23% है और कम से कम तीन 99.95%
- माध्य 12 है और प्रसरण भी, जिससे मानक विचलन √12 = 3.46 बनता है
यही वह उदाहरण है जो दोनों इनपुट खानों को अलग करता है: खिड़की की लंबाई के अलावा कुछ नहीं बदला, और जवाब 19.54% से खिसककर 0.18% हो गया। दोनों खाने ज़रूरी हैं क्योंकि पैरामीटर उनका गुणनफल है, और जो पेज सिर्फ़ दर लेता वह एक घंटे और एक दिन के लिए एक ही जवाब देता। सारांश पंक्तियाँ भी साथ चलती हैं — बारह घटनाएँ अपेक्षित होने पर तीन माध्य से दो मानक विचलन से भी ज़्यादा नीचे है, और इसीलिए कम से कम वाली पंक्ति अब लगभग निश्चित है।
एक घटना प्रति घंटा, और कुछ भी नहीं हुआ
- लैम्ब्डा = 1 के साथ ठीक शून्य घटनाओं का मौक़ा e⁻¹ = 0.3679 है, यानी 36.79%
- ज़्यादा से ज़्यादा शून्य भी वही सवाल है, इसलिए वह पंक्ति वही संख्या दोहरा देती है
- कम से कम शून्य हर संभव गिनती को समेटती है, इसलिए वह ठीक 100% है — 99.99% नहीं
- माध्य और प्रसरण दोनों 1 हैं, और मानक विचलन भी 1
लैम्ब्डा एक किताबों की शुरुआत है और यह इस पेज की सबसे उलटी लगने वाली संख्या बनाता है: घंटे में एक घटना के औसत से चलने वाली प्रक्रिया एक-तिहाई से ज़्यादा बार बिलकुल कुछ नहीं करती। कम से कम वाली पंक्ति भी पढ़ने लायक़ है — वह ठीक 100% है, क्योंकि "शून्य या उससे ज़्यादा" पूरा बंटन है, और जो पेज इसे किसी संचयी जोड़ से घटाकर निकालता, वह आसानी से 99.99% लौटा सकता था। शून्य घटनाएँ भी पूछने लायक़ एक जायज़ जवाब हैं, इसीलिए गिनती का खाना एक के बजाय शून्य से शुरू होता है।
सीमाएँ
पॉइसन नमूना दो ऐसी मान्यताओं पर टिका है जो चुपचाप टूटती हैं, और संख्याओं पर भरोसा करने से पहले दोनों जाँच लेनी चाहिए। घटनाएँ एक-दूसरे से स्वतंत्र होनी चाहिए, और उनकी दर आपके बताए अंतराल के भीतर बहती नहीं होनी चाहिए। स्वतंत्रता तब टूटती है जब आगमनों का कोई साझा कारण हो — बाधा के दौरान कॉलें उमड़ पड़ें, ख़राबियाँ कपड़े के एक थान पर झुंड बना लें, दुर्घटनाएँ ख़राब मौसम में इकट्ठा हो जाएँ — और इसका लक्षण यह है कि असली गिनतियाँ पेज के अनुमान से ज़्यादा बिखरी होती हैं, ख़ाली अंतराल भी ज़्यादा और बहुत व्यस्त भी ज़्यादा, जितना यह नमूना इजाज़त देता है। बहती दर दूसरी तरफ़ से टूटती है: जिस कॉल-सेंटर की रात शांत और सुबह व्यस्त हो, उसकी एक घंटे वाली दर होती ही नहीं, और दोनों का औसत ऐसी संख्या बनाता है जो किसी को भी बयान नहीं करती। इन मान्यताओं के आगे दो सीमाएँ समझाई नहीं, लागू की जाती हैं। अंतराल की लंबाई और दर दोनों वाजिब हद तक भरे जा सकते हैं, पर उनका गुणनफल रोका गया है, क्योंकि लाखों में पहुँची अपेक्षित गिनती पैनल की हर प्रायिकता को शून्य पर गोल कर देती और पेज शून्यों की तालिका छापने के बजाय मुकर जाना पसंद करता है। गिनती ख़ुद एक पूर्ण संख्या होनी चाहिए। और यहाँ पॉइसन प्रायिकताओं की कोई संदर्भ तालिका भी नहीं है: लोग जो तालिका चाहते हैं उसमें माध्य के हर मान पर एक पंक्ति होती है, और माध्य आपकी भरी हुई दर और अंतराल पर निर्भर है, इसलिए छपी हुई तालिका ऊपर के पैनल से अलग सवाल का जवाब देती।
अक्सर पूछे जाने वाले सवाल
- पॉइसन और द्विपद बंटन में क्या फ़र्क़ है?
- द्विपद बंटन तय संख्या के प्रयोगों में सफलताएँ गिनता है, इसलिए उसकी गिनती उस संख्या से आगे नहीं जा सकती; पॉइसन उन घटनाओं को गिनता है जो ख़ुद आती हैं, इसलिए वहाँ कोई ऊपरी छत नहीं और भरने के लिए कोई प्रयोग-संख्या भी नहीं। द्विपद को दो इनपुट चाहिए — कितने प्रयोग और हर एक का मौक़ा — जबकि इस पेज को दर और अंतराल चाहिए, जो मिलकर अकेली अपेक्षित गिनती बनाते हैं। दोनों उस संकरे मामले में मेल खाते हैं जहाँ प्रयोगों की संख्या बड़ी और हर एक का मौक़ा छोटा हो, और इसीलिए दुर्लभ घटनाओं का बखान दोनों तरह से किया जाता है। जहाँ आप मौक़े गिन सकें वहाँ द्विपद, और जहाँ घटनाएँ बस आती रहें वहाँ पॉइसन।
- यहाँ माध्य प्रसरण के बराबर क्यों होता है?
- क्योंकि यह तादात्म्य नमूने की बुनियाद है, उदाहरणों का संयोग नहीं: पॉइसन गिनती में माध्य और प्रसरण एक ही संख्या होते हैं, लैम्ब्डा, इसलिए मानक विचलन हमेशा माध्य का वर्गमूल होता है। इससे यह तेज़ जाँच मिलती है कि नमूना फ़िट बैठता है या नहीं: देखी गई गिनतियों का एक समूह लीजिए, उनका प्रसरण उनके माध्य से भाग दीजिए, और अगर अनुपात एक से बहुत ऊपर हो तो गिनतियाँ झुंड में हैं, स्वतंत्र नहीं, जबकि एक से बहुत नीचे होने का मतलब है कि वे संयोग से भी ज़्यादा बराबर हैं। दोनों में से कोई हालत अलग संख्याएँ भरने से ठीक नहीं होती — इसका मतलब है कि यह प्रक्रिया पॉइसन है ही नहीं।
- ज़्यादा से ज़्यादा k और कम से कम k एक-दूसरे के पूरक क्यों नहीं हैं?
- क्योंकि दोनों पंक्तियाँ ठीक k वाली गिनती को अपने में समेटती हैं, इसलिए जोड़ने पर वह नतीजा दो बार गिना जाता है। ऊपर के उदाहरण में ज़्यादा से ज़्यादा तीन 43.35% है और कम से कम तीन 76.19%, जिनका जोड़ 119.54% बनता है — और 100% से ऊपर का यही अतिरिक्त हिस्सा ठीक तीन घटनाओं का 19.54% है। यह वही अंकगणित है जो द्विपद की गिनती के साथ लगता है और वही जाल भी: कम से कम को एक घटाकर ज़्यादा से ज़्यादा पढ़ना उतनी ही ग़लती है जितनी उस घटना की प्रायिकता। असली पूरक चाहिए तो ज़्यादा से ज़्यादा k − 1 वाली संख्या लीजिए, या तीनों पंक्तियाँ साथ पढ़कर देख लीजिए कि ठीक k उनके बीच का अंतर भरता है।
- कोई गिनती असल में पॉइसन कब होती है?
- जब घटनाएँ स्वतंत्र हों, दर अंतराल भर एक-सी रहे, और घटनाएँ अपने मौक़ों के मुक़ाबले दुर्लभ हों। स्वतंत्रता ही वह मान्यता है जो पूरा काम करती है और सबसे ज़्यादा टूटती भी है, क्योंकि झुंड बनना सारांश संख्याओं से पकड़ में नहीं आता: जो कारख़ाना हर महीने एक ही कुल ख़राबी बताता हो, वह फिर भी ख़राब दिन और शांत दिन झेल रहा हो सकता है, और वह झुंड इस पेज के अनुमान से ज़्यादा बिखरी गिनतियों के रूप में सामने आएगा। काम की जाँच वही है जो पिछले जवाब में थी — गिनतियों के समूह के प्रसरण को उनके माध्य से मिलाइए। क़रीब-क़रीब बराबर हों तो नमूना अच्छा बखान है; बहुत दूर हों तो कोई भी दर चुनकर इसे ठीक नहीं किया जा सकता।
- दर शून्य हो तो क्या होता है?
- अंतराल में कुछ भी घटित नहीं हो सकता, इसलिए शून्य की गिनती की प्रायिकता 100% है और हर दूसरी गिनती की 0%। पेज यही बताता है, फ़ेल नहीं होता: शून्य की दर या शून्य लंबाई का अंतराल, दोनों शून्य लैम्ब्डा देते हैं जिसमें कोई घटना अपेक्षित नहीं है, और एक या ज़्यादा घटनाओं के बारे में पूछने पर 0% लौटता है जबकि किसी के न होने पर 100%। यह जानना काम का है कि इसे साफ़-साफ़ निपटाया गया है, क्योंकि जैसा सूत्र लिखा है उसमें शून्य की k-वीं घात और लघुगणक से आती ऋणात्मक अनंत दोनों मौजूद हैं, और इसे भोलेपन से हल करने वाला कार्यक्रम स्पष्ट जवाब के बजाय कोई बेतुका नतीजा निकाल देता है।
- इस पेज पर पॉइसन प्रायिकताओं की तालिका क्यों नहीं है?
- क्योंकि ऐसी तालिका की हर पंक्ति माध्य के किसी और मान की होती है, और यहाँ माध्य आपकी भरी हुई दो संख्याओं का गुणनफल है। छपी हुई तालिका एक दर और एक अंतराल के लिए सही होती और बाक़ी हर जोड़े के लिए ग़लत, इसलिए वह पैनल से अलग सवाल का जवाब देती — और जहाँ दोनों टकराते, वहाँ सही पैनल होता। पैनल ही तालिका है: तीनों प्रायिकता-पंक्तियाँ आपके बताए माध्य के लिए ठीक, ज़्यादा से ज़्यादा और कम से कम वाली संख्याएँ हैं, और दर या अंतराल बदलते ही वे फिर से गिनी जाती हैं। संदर्भ तालिकाएँ उन पेजों पर बनती हैं जिनकी पंक्तियाँ किसी इनपुट पर निर्भर न हों, जैसे कोई ग्रेडिंग पैमाना या कट-ऑफ़ पट्टियों का समूह।
संदर्भ
- 4.3 Binomial Distribution — Introductory Statistics 2e (the fixed number of independent trials with a constant success probability, which is precisely the constraint a Poisson count does not have) — OpenStax, Rice University
- 1.3.6.6.1. Normal Distribution — e-Handbook of Statistical Methods (the density, the role of the mean and standard deviation, and the standard normal as the reference case a large-mean Poisson count approaches) — National Institute of Standards and Technology (NIST)
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (what it means for a count to have a distribution, and how probabilities are read off the outcomes it assigns them to) — National Institute of Standards and Technology (NIST)