बेयस प्रमेय कैलकुलेटर
नतीजा
पश्च प्रायिकता P(A|E)
- A ग़लत होने की प्रायिकता P(¬A|E)
- 84.62%
- साक्ष्य की प्रायिकता P(E)
- 5.85%
- पूर्व से पश्च प्रायिकता में बदलाव (प्रतिशत अंक)
- 14.38
बेयस प्रमेय कैलकुलेटर पहले से मानी हुई किसी शर्त की पूर्व प्रायिकता को साक्ष्य मिलने के बाद की पश्च प्रायिकता में बदल देता है। तीन संख्याएँ भरिए — शर्त की पूर्व प्रायिकता P(A), शर्त सही होने पर साक्ष्य की प्रायिकता P(E|A), और शर्त ग़लत होने पर उसी साक्ष्य की प्रायिकता P(E|¬A) — और पैनल पश्च प्रायिकता P(A|E) के साथ उसका पूरक, साक्ष्य की प्रायिकता P(E), तथा पूर्व से पश्च तक का बदलाव प्रतिशत अंकों में छाप देता है। यह गणना तब सबसे ज़रूरी होती है जब शर्त दुर्लभ हो और परीक्षण अचूक न हो: आधार दर 1%, संवेदनशीलता 90% और ग़लत सकारात्मक दर 5% पर एक पॉज़िटिव नतीजा शर्त की प्रायिकता को करीब 15% तक ही पहुँचाता है, नब्बे तक नहीं। मोटा अंदाज़ा कभी-कभी पर्याप्त होता है, पर जहाँ नतीजे पर कोई फ़ैसला टिका हो वहाँ यह पेज बताता है कि अंदाज़ा कितना ग़लत था।
फ़ॉर्मूला
P(A | E) = P(E | A) · P(A) / [ P(E | A) · P(A) + P(E | ¬A) · P(¬A) ]
- P(A)
- शर्त की पूर्व प्रायिकता, प्रतिशत में भरी गई — साक्ष्य मिलने से पहले आप क्या मानते थे। यह सोच से कहीं ज़्यादा असर डालती है: जब यह छोटी हो, तो इसे दूर तक हिलाने के लिए बहुत ढेर सारा साक्ष्य चाहिए
- P(E | A)
- शर्त मौजूद होने पर वही साक्ष्य मिलने की प्रायिकता। किसी परीक्षण में यह उसकी संवेदनशीलता है — यानी सचमुच मौजूद मामलों में से कितने परीक्षण पकड़ पाता है
- P(E | ¬A)
- शर्त मौजूद न होने पर भी वही साक्ष्य मिलने की प्रायिकता। परीक्षण की भाषा में यह ग़लत सकारात्मक दर है, और यही पद सबसे ज़्यादा नुक़सान करता है जब यह छोटा न हो
- P(¬A)
- शर्त मौजूद न होने की प्रायिकता, यानी 100% में से पूर्व प्रायिकता घटाकर। भाजक साक्ष्य के मिलने के दोनों रास्ते जोड़ता है, और हर रास्ते को उसकी हालत कितनी आम है उससे भार देता है
- P(E)
- साक्ष्य के कुल मिलने की प्रायिकता, शर्त हो या न हो। यही भाजक है, और पैनल इसे अलग से छापता है क्योंकि यहाँ छोटा मान ही पश्च प्रायिकता को तेज़ी से खिसकाता है
- P(A | E)
- पश्च प्रायिकता: साक्ष्य के बाद की मान्यता। पैनल इसका पूरक भी छापता है, क्योंकि 'जाँच पॉज़िटिव आई और फिर भी 85% मौक़ा है कि शर्त न हो' — यह वाक्य अक्सर 15.38% से ज़्यादा समझा देता है
इसे हर उस मौक़े पर उठाइए जहाँ किसी परीक्षण के नतीजे को इस बात के सामने पढ़ना हो कि जिसकी जाँच हो रही है वह असल में कितनी आम है: कम आधार दर वाली आबादी में छँटाई परीक्षण, किसी शब्द को पढ़ता स्पैम फ़िल्टर, किसी दुर्लभ ख़राबी की जाँच, या कोई भी हालत जहाँ पॉज़िटिव नतीजे को सबूत मान लिया जा रहा हो। यह उलटे सवाल के लिए भी सही औज़ार है — कि पॉज़िटिव नतीजे का कोई मतलब बनने से पहले परीक्षण कितना अच्छा होना चाहिए, और यह आम तौर पर किसी एक पूर्व मान के पश्च मान से कहीं ज़्यादा काम का आँकड़ा होता है। जब आपके पास कहने लायक़ कोई पूर्व मान हो तभी इसे उठाइए; जब पूर्व मान का अंदाज़ा ही न हो, तो ईमानदार जवाब यह है कि पश्च मान पर उसी अनजान का राज रहेगा — और पैनल आपको ठीक-ठीक दिखा देता है कि कितना।
हल किए हुए उदाहरण
1% शर्त, 90% संवेदनशीलता और 5% ग़लत सकारात्मक दर
- 10000 लोग मानिए: इनमें से लगभग 100 में शर्त मौजूद है और 9900 में नहीं
- जिन 100 में है, उनमें 90% की जाँच पॉज़िटिव आती है, यानी करीब 90 सच्चे सकारात्मक
- जिन 9900 में नहीं है, उनमें भी 5% की जाँच पॉज़िटिव आती है, यानी करीब 495 ग़लत सकारात्मक
- यानी एक पॉज़िटिव नतीजा 90 + 495 = 585 लोगों से आता है, और 90 / 585 = 15.38%
यही वह मामला है जिसके इर्द-गिर्द यह पूरा पेज बना है, और वजह स्टेप्स का हिसाब है। लोगों को गिनने से तंत्र दिखने लगता है: ग़लत सकारात्मक दर उस समूह पर लगती है जो शर्त वाले समूह से निन्यानवे गुना बड़ा है, इसलिए वह संवेदनशीलता से साढ़े पाँच गुना ज़्यादा पॉज़िटिव नतीजे बनाती है। 15.38% यह नहीं कहता कि परीक्षण ख़राब है — 90% संवेदनशीलता अच्छी है — यह कहता है कि शर्त इतनी दुर्लभ थी कि ग़लतियाँ सही पकड़ से आगे निकल गईं। पूरक 84.62% वही बात दूसरी तरफ़ से कहता है, और 14.38 प्रतिशत अंक का खिसकाव बताता है कि इस गुणवत्ता की एक जाँच यहाँ असल में कितनी कीमत रखती है।
2% शर्त और 99% सटीक परीक्षण
- 10000 लोग मानिए: करीब 200 में शर्त मौजूद है और 9800 में नहीं
- उन 200 में से 99% की जाँच पॉज़िटिव आती है: करीब 198 सच्चे सकारात्मक
- उन 9800 में से 1% की फिर भी पॉज़िटिव आती है: करीब 98 ग़लत सकारात्मक
- एक पॉज़िटिव नतीजा 198 + 98 = 296 लोगों से आता है, और 198 / 296 = 66.89%
सौ में एक बार ग़लत होने वाला परीक्षण भी अपने एक-तिहाई पॉज़िटिव नतीजे ग़लत छोड़ता है, क्योंकि वह उस समूह पर लगता है जो उनतालीस गुना बड़ा है। उसी 452 प्रति 10000 पर सटीकता 99.9% कर दीजिए और पश्च प्रायिकता 95% के पार चली जाती है — यानी दोनों लीवर एक-दूसरे की भरपाई नहीं करते। संवेदनशीलता तय करती है कि कितने सच्चे सकारात्मक मिलेंगे, और ग़लत सकारात्मक दर तय करती है कि वे कितने शोर में दबे हैं; दूसरी को सुधारना आम तौर पर पहली को सुधारने से कहीं ज़्यादा देता है, और बेहतर परीक्षण मँगाने से पहले यह देखने का यह सबसे सस्ता तरीक़ा है।
शर्त के विपक्ष में जाता साक्ष्य
- बराबर की पूर्व मान्यता से शुरू: शर्त के पक्ष में 50% और विपक्ष में 50%
- साक्ष्य शर्त न होने पर पाँच गुना ज़्यादा मुमकिन है (90% बनाम 5%)
- भाजक 0.05 × 0.5 + 0.9 × 0.5 = 0.475 है, यानी साक्ष्य अपने आप में काफ़ी मुमकिन है
- पश्च प्रायिकता 0.025 / 0.475 = 5.26%, यानी 44.74 प्रतिशत अंक की गिरावट
ऋणात्मक खिसकाव पर ठहरना ज़रूरी है, और प्रतिशत अंक वाली इकाई इसी के लिए रखी गई है। 50% से 5.26% तक गिरना 44.74 प्रतिशत अंक की गिरावट है; यह 44.74% की गिरावट नहीं है — वह कहती कि पश्च प्रायिकता करीब 27.6% पर बैठ गई, जो ग़लत है। खिसकाव को सापेक्ष बदलाव की तरह पढ़ना इस पैनल को ग़लत उद्धृत करने का सबसे आम तरीक़ा है, और चिह्न ही बताता है कि साक्ष्य ने उलटी दिशा में धक्का दिया। यह भी देखिए कि यहाँ साक्ष्य अपने आप में ख़ास नहीं है — मिलने की 47.5% प्रायिकता — फिर भी ज़ोरदार जानकारी देता है, क्योंकि जानकारी दोनों प्रायिकताओं के अनुपात से आती है, साक्ष्य के दुर्लभ होने से नहीं।
सीमाएँ
पश्च प्रायिकता उतनी ही भरोसेमंद है जितनी आपकी भरी हुई तीन संख्याएँ, और पूर्व प्रायिकता वही है जिसे लोग सबसे ज़्यादा अंदाज़े से भर देते हैं। जब शर्त दुर्लभ हो तो पश्च प्रायिकता पर पूर्व प्रायिकता और ग़लत सकारात्मक दर का राज चलता है, इसलिए इनमें से किसी एक का आशावादी अंदाज़ा एक पक्का और ग़लत जवाब देता है — पैनल यह नहीं बता सकता कि आपका पूर्व मान केवल अंदाज़ा था। दो और सावधानियाँ। पहली, दोनों प्रायिकताएँ सटीक मानी गई हैं, इसलिए किसी छोटे सत्यापन अध्ययन से उठाई गई संवेदनशीलता उस सटीकता से बरती जा रही है जो उसमें नहीं है। दूसरी, यह हिसाब एक साक्ष्य के एक बार पढ़े जाने का है: एक ही परीक्षण दो बार लगाना दो स्वतंत्र परीक्षण लगाने जैसा नहीं है, क्योंकि उसी अपूर्ण यंत्र का दूसरा नतीजा पहले से सहसंबद्ध होता है — पश्च प्रायिकता को नई पूर्व प्रायिकता बनाकर फिर भरने से दूसरी जाँच का योगदान बढ़ा-चढ़ा कर दिखेगा। जहाँ साक्ष्य किसी भी हालत में मुमकिन ही न हो — दोनों प्रायिकताएँ 0%, या 0% ग़लत सकारात्मक दर के साथ 0% पूर्व मान — वहाँ भाजक शून्य हो जाता है और बताने के लिए कोई पश्च प्रायिकता नहीं बचती, क्योंकि जो हो ही नहीं सकता उस पर शर्त लगाना ऐसा सवाल है जिसका कोई जवाब नहीं होता।
अक्सर पूछे जाने वाले सवाल
- 90% सटीक परीक्षण शर्त होने की केवल 15% प्रायिकता क्यों देता है?
- क्योंकि जिनमें शर्त है उन पर सटीकता और जिनमें नहीं है उन पर सटीकता — ये दो अलग संख्याएँ हैं, और दूसरी बहुत बड़े समूह से गुणा होती है। 1% आधार दर पर शर्त न रखने वाले लोग शर्त रखने वालों से निन्यानवे गुना हैं, इसलिए 5% ग़लत सकारात्मक दर सैकड़ों ग़लत नतीजे बनाती है जहाँ 90% संवेदनशीलता कुछ दहाई सच्चे नतीजे देती है। परीक्षण अपना काम कर रहा है; शर्त बस इतनी दुर्लभ है कि उसकी ग़लतियाँ उसकी पकड़ से आगे निकल जाती हैं। यही आधार दर का असर है, और इसीलिए पूर्व प्रायिकता एक ज़रूरी इनपुट है, बाद की सोच नहीं।
- खिसकाव वाली पंक्ति में प्रतिशत अंक क्या बताते हैं?
- वे पूर्व और पश्च प्रायिकता के बीच का अंतर हैं, जिसे सापेक्ष बदलाव की तरह नहीं बल्कि प्रतिशत अंकों में नापा गया है। 50% से 5.26% जाना −44.74 प्रतिशत अंक का खिसकाव है; यह 44.74% की गिरावट नहीं है, क्योंकि उसका मतलब होता कि पश्च प्रायिकता करीब 27.6% पर आ गई। यह फ़र्क़ बड़े खिसकावों में सबसे ज़्यादा मायने रखता है, जहाँ सापेक्ष पढ़त बुरी तरह ग़लत हो जाती है, और चिह्न ही बताता है कि साक्ष्य ने किस तरफ़ धक्का दिया — ऋणात्मक खिसकाव का मतलब है कि साक्ष्य शर्त के ख़िलाफ़ गया।
- क्या मैं पश्च प्रायिकता को अगली जाँच की पूर्व प्रायिकता बना सकता हूँ?
- तभी, जब दूसरा साक्ष्य सचमुच पहले से स्वतंत्र हो। एक ही परीक्षण के दो नतीजे स्वतंत्र नहीं होते: एक बार ग़लत सकारात्मक आने पर अगली बार भी आने का मौक़ा बढ़ जाता है, क्योंकि यंत्र की वही ख़ामी दोनों बार मौजूद रहती है। फिर भी पश्च प्रायिकता को नई पूर्व प्रायिकता बनाकर भरने से दूसरे नतीजे का योगदान बढ़ा-चढ़ा कर दिखेगा — कभी-कभी बहुत ज़्यादा। जब साक्ष्य वाक़ई स्वतंत्र हो, तब दो चरणों में अपडेट करने का नतीजा वही आता है जो दोनों टुकड़ों को एक साथ लेकर एक बार अपडेट करने पर, इसलिए यह शॉर्टकट ठीक तभी सुरक्षित है जब स्वतंत्रता की शर्त निभती हो।
- साक्ष्य की प्रायिकता वाली पंक्ति का क्या मतलब है?
- यह साक्ष्य के कुल मिलने की प्रायिकता है — शर्त हो या न हो — यानी प्रमेय का भाजक, जिसमें हर प्रायिकता को उसकी हालत कितनी आम है उससे भार दिया जाता है। इसे दिखाना इसलिए काम का है कि यही बताता है कि छलाँग कितनी बड़ी होगी: जब साक्ष्य कुल मिलाकर दुर्लभ हो तो पूर्व से बहुत दूर पश्च प्रायिकता आना स्वाभाविक है, और जब वह आम हो तो कुछ भी हिलाने के लिए ज़ोरदार अनुपात चाहिए। पहले उदाहरण में साक्ष्य 5.85% लोगों में मिलता है, और इसीलिए एक पॉज़िटिव नतीजा मान्यता को इतना दूर खिसका देता है।
- कब कोई जवाब ही नहीं होता?
- जब साक्ष्य किसी भी हालत में मुमकिन न हो, जिससे भाजक शून्य हो जाता है और उस पर शर्त लगाना अपरिभाषित रह जाता है। ऐसा तब होता है जब दोनों प्रायिकताएँ 0% हों, जब पूर्व मान 0% हो और ग़लत सकारात्मक दर भी 0%, या जब पूर्व मान 100% हो और संवेदनशीलता 0% — हर बार साक्ष्य हो ही नहीं सकता, इसलिए 'साक्ष्य के मिलने पर' एक ख़ाली शर्त रह जाती है। पैनल 0% या 50% लौटाने के बजाय त्रुटि दिखाता है, क्योंकि यहाँ बताने के लिए प्रायिकता मौजूद ही नहीं, शून्य प्रायिकता नहीं।
- क्या यह कैलकुलेटर प्रायिकता-अनुपात भी देता है?
- नहीं, और वजह यह है कि ऑड्स वाला रूप इनपुट की सीमाओं पर टूट जाता है। किसी घटना के ऑड्स उसकी प्रायिकता को एक में से वही प्रायिकता घटाकर भाग देने से बनते हैं, इसलिए 100% की पूर्व प्रायिकता अनंत ऑड्स देती है, और उसे छापना किसी को जानकारी देने के बजाय पैनल ही तोड़ देगा। खिसकाव वाली पंक्ति वही काम ऐसे रूप में करती है जो हर वैध इनपुट पर टिकता है: वह बताती है कि एक साक्ष्य मान्यता को कितना और किस दिशा में खिसकाता है, और प्रायिकता-अनुपात माँगने के पीछे आम तौर पर यही सवाल होता है।
संदर्भ
- Bayes' Theorem — Stanford Encyclopedia of Philosophy (the theorem itself, its special forms including the odds form, and the subjectivist reading of probability as degree of belief) — Stanford Encyclopedia of Philosophy, Stanford University
- 3.3 Two Basic Rules of Probability — Introductory Statistics 2e (the multiplication rule and conditional probability, which are the two pieces the posterior is assembled from) — OpenStax, Rice University
- 3.5 Tree and Venn Diagrams — Introductory Statistics 2e (the tree-diagram route to the same posterior, which is the count-of-people arithmetic used in the worked examples above) — OpenStax, Rice University