काई-वर्ग कैलकुलेटर
नतीजा
काई-वर्ग सांख्यिकी
- P-मान
- 0.0170%
- स्वतंत्रता की कोटि
- 3
- सबसे छोटी अपेक्षित गिनती
- 25.0000
काई-वर्ग कैलकुलेटर गिनी गई श्रेणियों की तुलना उन आवृत्तियों से करता है जिनकी आपने अपेक्षा की थी, और काई-वर्ग सांख्यिकी, उसकी स्वतंत्रता की कोटि तथा उसके साथ जाने वाला P-मान बताता है। जिस भी सवाल का ढाँचा यह हो कि ये समूह बराबर के हैं क्या, उसके पीछे यही परीक्षण है: पासा साफ़ है या नहीं, चार विकल्पों को लोगों ने बराबर चुना या नहीं, हर श्रेणी की देखी गई गिनती उस अपेक्षित गिनती से मिलती है या नहीं जिसकी भविष्यवाणी का आपके पास कोई आधार था। अपेक्षित गिनतियाँ ख़ाली छोड़ दीजिए और पेज मान लेता है कि सब श्रेणियाँ बराबर प्रायिकता वाली हैं, जो सबसे आम मामला भी है और वह भी जिसमें पहले कोई हिसाब करना नहीं पड़ता। दोनों सूचियाँ जोड़ी में चलती हैं — मानों की संख्या एक जितनी होनी चाहिए और हर मान अपनी श्रेणी के ठीक सामने — इसलिए लिखने का क्रम इनपुट का हिस्सा है। सबसे छोटी अपेक्षित गिनती साथ-साथ छपती है, क्योंकि परीक्षण की अपनी शर्तें उसी संख्या से जाँची जाती हैं।
फ़ॉर्मूला
χ² = Σ ( O − E )² / E df = k − 1 p = P( χ² ≥ χ²₀ )
- O
- हर श्रेणी की देखी गई गिनती — यह माप नहीं, गिनती है, इसलिए संख्याएँ पूर्ण होती हैं और उनका जोड़ नमूने का आकार बनता है। शून्य की गिनती मान्य है: इसका मतलब है कि वह श्रेणी एक बार भी सामने नहीं आई, जो एक नतीजा है, कोई ग़लती नहीं
- E
- हर श्रेणी की अपेक्षित गिनती, यानी वह जिसकी भविष्यवाणी शून्य परिकल्पना करती है, वह नहीं जो आप देखना चाहते हैं। ख़ाली छोड़ने पर यह कुल को श्रेणियों की संख्या से भाग देकर बन जाती है, और परीक्षण पूछता है कि सब श्रेणियाँ बराबर प्रायिकता वाली हैं या नहीं। सूची में जितने मान लिखे हों उतनी ही अपेक्षित गिनतियाँ लिखनी होती हैं, और हर एक अपनी श्रेणी के ठीक सामने — दोनों सूचियाँ जोड़ी में चलती हैं और क्रम बदलने पर जवाब बदल जाता है
- k
- श्रेणियों की संख्या, जो आपकी लिखी सूची की लंबाई से पढ़ी जाती है। यही स्वतंत्रता की कोटि तय करती है और ख़ाली छोड़े जाने पर अपेक्षित गिनतियों का औसत भी इसी पर निकलता है, इसलिए गिनतियों की एक ही सूची दोनों चीज़ें तय कर देती है
- df
- स्वतंत्रता की कोटि, जो k − 1 है, k नहीं। घटाव वही हिस्सा है जो लोग भूल जाते हैं: कुल और आख़िरी को छोड़कर बाक़ी सारी गिनतियाँ तय हो जाने पर आख़िरी गिनती अपने आप तय हो जाती है, इसलिए श्रेणियों में उनकी संख्या से एक कम सूचना रहती है
- χ²₀
- यह पेज जो काई-वर्ग सांख्यिकी निकालता है, वही अपने शून्य बंटन में डाली जाती है ताकि पूँछ का क्षेत्र मिल जाए। यह वही काम है जो सामान्य वक्र से कोई मान पढ़ते समय होता है, बस सामान्य की जगह काई-वर्ग का वक्र लग जाता है — और इसीलिए P-मान को सांख्यिकी के साथ स्वतंत्रता की कोटि भी चाहिए
इसे तब इस्तेमाल कीजिए जब आँकड़ा श्रेणियों में गिरती गिनतियों का समूह हो, और सवाल यह हो कि वे गिनतियाँ किसी भविष्यवाणी से मेल खाती हैं या नहीं। गिनती ही इस परीक्षण को माध्य और अनुपात वाले परीक्षणों से अलग बनाती है: यहाँ मान किसी पैमाने पर नापे नहीं जाते, और मायने यह रखता है कि हर टोकरी में कितने गिरे, न कि उनमें से कोई कितना बड़ा था। भविष्यवाणी बराबर बँटवारा हो सकती है, या पिछले आँकड़ों से बनी अपेक्षित गिनतियों का समूह — किसी राष्ट्रीय दर को स्थानीय समष्टि पर लगाना, मेंडल का अनुपात, किसी मॉडल का नतीजा। परीक्षण उतना ही अच्छा होता है जितनी वे अपेक्षाएँ: वह आपकी गिनी हुई संख्या की तुलना आपके कहे से करता है, और यह नहीं पकड़ेगा कि अपेक्षा ख़ुद ग़लत थी। P-मान पर भरोसा करने से पहले दो शर्तें जाँच लेने लायक हैं, और पहली यह पेज ख़ुद छाप देता है, क्योंकि सबसे छोटी अपेक्षित गिनती ही वह संख्या है जिसके बारे में आम नियम-मात्र कहा जाता है।
हल किए हुए उदाहरण
चार श्रेणियाँ, असमान गिनती के साथ, और अपेक्षित गिनतियाँ ख़ाली
- कुल 100 है, और ख़ाली अपेक्षा के साथ चारों में से हर श्रेणी में 100 / 4 = 25 होने की अपेक्षा है
- 25 से वर्गित अंतर: (30 − 25)² = 25, (10 − 25)² = 225, (20 − 25)² = 25, (40 − 25)² = 225
- हर एक को उसकी अपेक्षा 25 से भाग दीजिए और जोड़िए: 1 + 9 + 1 + 9 = 20
- स्वतंत्रता की कोटि: k − 1 = 3, और 20 से आगे की ऊपरी पूँछ 0.017% है
यह इस पेज का डिफ़ॉल्ट है, और इसे जान-बूझकर असमान चुना गया है: 25 की अपेक्षा के सामने 40 और 10। P-मान 0.017% आता है, इसलिए गिनतियाँ बराबर बँटवारे से बहुत दूर हैं, और 25 की सबसे छोटी अपेक्षित गिनती आम इस्तेमाल की किसी भी सीमा से आराम से ऊपर है — यानी यहाँ P-मान के पीछे का सन्निकटन मज़बूत ज़मीन पर है। ध्यान दीजिए कि अपेक्षित गिनतियाँ कभी लिखनी ही नहीं पड़ीं। ख़ाली छोड़ना ही बराबर बँटवारा कहने का तरीक़ा है, और इसी वजह से वह फ़ील्ड वैकल्पिक है।
तीन श्रेणियाँ, पिछले सर्वेक्षण से ली गई अपेक्षित गिनतियों के सामने
- दोनों सूचियों में तीन-तीन मान हैं और उनका जोड़ 100 है, इसलिए अपेक्षा गिनतियों से मेल खाती है और परीक्षण आगे बढ़ सकता है
- वर्गित अंतर: (50 − 60)² = 100, (30 − 30)² = 0, (20 − 10)² = 100
- हर अपेक्षा से भाग दीजिए और जोड़िए: 100/60 + 0/30 + 100/10 = 1.6667 + 0 + 10 = 11.6667
- स्वतंत्रता की कोटि: 3 − 1 = 2, और 11.6667 से आगे की ऊपरी पूँछ 0.2928% है
दोनों सूचियाँ एक ही संख्या में लिए गए मानों का बखान करती हैं, और यहाँ दोनों 100 पर आती हैं — इसी से दूसरी सूची पहली के बारे में एक परिकल्पना बनती है, कोई दूसरा प्रयोग नहीं। पदों को एक-एक करके पढ़ना सिखाता है: बीच की श्रेणी अपनी अपेक्षा से ठीक मिली और उसका योगदान शून्य रहा, जबकि तीसरी ने सबसे छोटी श्रेणी होने के बावजूद कुल अंकों में से दस दिए, क्योंकि वह अपनी अपेक्षा से 100% चूकी। 10 की सबसे छोटी अपेक्षा अब भी आम तौर पर माँगे जाने वाले स्तर से ऊपर है।
एक सिक्का 20 बार उछाला गया, बराबर बँटवारे के सामने परखा गया
- अपेक्षित गिनतियाँ: 20 उछाल दो नतीजों में बराबर बाँटने पर 10 और 10
- वर्गित अंतर: (12 − 10)² = 4 और (8 − 10)² = 4
- भाग दीजिए और जोड़िए: 4/10 + 4/10 = 0.8
- स्वतंत्रता की कोटि: 2 − 1 = 1, और 0.8 से आगे की ऊपरी पूँछ 37.1093% है
20 में 12 चित एक पक्षपाती सिक्के जैसा लगता है, जब तक पूँछ की प्रायिकता न पढ़ ली जाए: 37% साफ़ सिक्के भी कम से कम इतना असमान बँटवारा देते हैं, इसलिए नतीजा कुछ ख़ास नहीं है। यह वही हिसाब है जो पहले उदाहरण में था, सबसे छोटी काम की तालिका पर किया गया, और यह दिखाता है कि काई-वर्ग सांख्यिकी को अकेले कभी क्यों नहीं पढ़ा जाता — 0.8 और 20 तुलनीय संख्याएँ नहीं हैं, और उन्हें एक पैमाने पर सिर्फ़ P-मान रखता है। दो श्रेणियों वाले मामले में एक छोटा रास्ता भी जान लेने लायक है: काई-वर्ग सांख्यिकी उस z के वर्ग के बराबर होती है जो दो-अनुपात वाला परीक्षण इस्तेमाल करता है।
सीमाएँ
P-मान एक ऐसे सन्निकटन पर टिका है जिसके लिए अपेक्षित गिनतियों का ठीक-ठाक बड़ा होना ज़रूरी है, और छपी हुई सबसे छोटी अपेक्षित गिनती वही संख्या है जिससे यह जाँचा जाता है — पाठ्यपुस्तकें इस रेखा पर एकमत नहीं हैं, 'हर श्रेणी में कम से कम 5' और 'हर श्रेणी में कम से कम 1 तथा ज़्यादातर में 5' दोनों ख़ूब चलते हैं। अपेक्षाएँ बहुत छोटी होने पर सन्निकटन चुपचाप विफल होता है और ऐसा P-मान लौटाता है जो साधारण दिखता है। गिनतियों को एक-दूसरे से स्वतंत्र भी मान लिया जाता है, जो जोड़ीदार या दोहराई गई मापों में और समूहों में बँटे नमूनों में टूटती है, और इनमें से हर एक सांख्यिकी को बड़ा कर देती है। अपेक्षाएँ ख़ुद दी हुई मानी जाती हैं, इसलिए ग़लत भविष्यवाणी के सामने किया गया परीक्षण उस सवाल का जवाब देता है जो पूछा गया था उससे अलग है। और आख़िर में, छोटा P-मान इतना ही कहता है कि गिनतियाँ अपेक्षा से मेल नहीं खातीं, यह नहीं कि क्यों: वह यह नहीं बताता कि कौन-सी श्रेणी ज़िम्मेदार है, और कई श्रेणियों के मामले में जिन अंतरों से सांख्यिकी बनी है उन्हें अलग से देख लेना बनता है।
अक्सर पूछे जाने वाले सवाल
- काई-वर्ग परीक्षण असल में क्या बताता है?
- यह बताता है कि आपकी देखी गई गिनतियाँ उन आवृत्तियों से मेल खाती हैं या नहीं जिनकी आपने अपेक्षा की थी, यह देखते हुए कि कुल कितने मान हैं। सांख्यिकी अवलोकन और अपेक्षा के बीच के कुल वर्गित अंतर के साथ बढ़ती है, और हर पद को उसकी अपेक्षा के आकार से बाँटा जाता है, इसलिए वही अनुपाती अंतर छोटी अपेक्षाओं के साथ ज़्यादा मायने रखता है। फिर P-मान बताता है कि एक निष्पक्ष दुनिया में इतना बड़ा या उससे बड़ा अंतर कितनी बार बनता है। यह पूरी तालिका का परीक्षण है, किसी एक श्रेणी का नहीं, और जब एक श्रेणी साफ़ तौर पर अलग दिख रही हो तब ये दोनों बातें आसानी से मिल जाती हैं।
- अपेक्षित गिनतियाँ ख़ाली छोड़ दें तो क्या होता है?
- पेज मान लेता है कि सब श्रेणियाँ बराबर प्रायिकता वाली हैं और अपेक्षित गिनती को कुल भाग श्रेणियों की संख्या के रूप में निकालता है। यह इस परीक्षण का सबसे आम इस्तेमाल है — एक पासा, एक चरखी, चार बटन जिन पर बराबर ट्रैफ़िक आना चाहिए — और इससे ऐसी सूची लिखने की मेहनत बच जाती है जिसके सारे मान वैसे भी एक जैसे हैं। जब बँटवारे की भविष्यवाणी करने के लिए पहले का कोई आँकड़ा न हो, तब यही एकमात्र पठन उपलब्ध है। जब भी आपके पास परखने लायक कोई असली भविष्यवाणी हो, तब अपेक्षित गिनतियाँ लिखिए, जैसे पिछले साल का बँटवारा या कोई सैद्धांतिक अनुपात, क्योंकि बराबर बँटवारे के सामने किया गया परीक्षण और किसी ठोस मॉडल के सामने किया गया परीक्षण दो अलग सवालों के जवाब देते हैं, और आपके पास पहले से मौजूद सूचना सिर्फ़ दूसरा इस्तेमाल करता है।
- दोनों सूचियों की लंबाई और जोड़ एक जैसे क्यों होने चाहिए?
- क्योंकि फ़िट के परीक्षण में अपेक्षित गिनतियाँ कुल मानों की संख्या से निकलती हैं, मनमर्जी से चुनी नहीं जातीं — वे बताती हैं कि परिकल्पना सच होने पर वही मान किस तरह बँटे होते। अलग-अलग जोड़ वाली दो सूचियाँ दो अलग प्रयोगों का बखान करती हैं, और उनसे निकाली गई सांख्यिकी किसी चीज़ का परीक्षण नहीं है; उसी तरह दोनों सूचियों में मानों की संख्या भी बराबर होनी चाहिए, और हर अपेक्षित गिनती अपनी श्रेणी के ठीक सामने — दो में से एक प्रविष्टि हटा दीजिए और उसके बाद का हर जोड़ा खिसक जाता है, और जवाब चुपचाप बदल जाता है। जब हर अपेक्षित गिनती पूर्ण संख्या में लिखी जाए, तब हर एक आधे इकाई तक इधर-उधर हो सकती है बिना मतलब बदले, इसलिए पेज हर श्रेणी पर 0.5 की छूट देता है: 60 के कुल के सामने 20.5; 20.5; 20.5 स्वीकार होता है, क्योंकि वे 20-20 के ठीक बराबर बँटवारे के गोल किए हुए मान हैं।
- किसी श्रेणी की गिनती शून्य हो सकती है?
- देखी गई गिनती के लिए हाँ, अपेक्षित के लिए नहीं, और यह असमानता सीधे सूत्र से आती है। शून्य का अवलोकन एक साधारण नतीजा है — ऐसी श्रेणी जो कभी सामने ही नहीं आई — और वर्गित अंतर अपने आप बड़ा बनता है, जो होना ही चाहिए। शून्य की अपेक्षा इस्तेमाल नहीं की जा सकती क्योंकि वह भाजक है और पद अनंत हो जाएगा: 'यह श्रेणी कभी नहीं आ सकती' ऐसी भविष्यवाणी है जिसे यह परीक्षण किसी गिनती के सामने तौल ही नहीं सकता। अगर कोई असली अपेक्षा शून्य नहीं, बस बहुत छोटी हो, तो परीक्षण उसे ले लेता है, और नतीजे के नीचे छपी सबसे छोटी अपेक्षित गिनती वही जगह है जहाँ देखा जा सकता है कि यह मुश्किल है या नहीं।
- काई-वर्ग के क्रांतिक मान की तालिका कहाँ है?
- इस पेज पर नहीं, उसी वजह से जिस वजह से P-मान वाले पेज पर नहीं है: जो एक मान चाहिए वह पहले ही छप चुका है, क्योंकि सांख्यिकी और उसकी स्वतंत्रता की कोटि पूँछ का क्षेत्र सीधे तय कर देती हैं। तालिका किसी एक सार्थकता स्तर पर ही बनाई जा सकती है, इसलिए 1% पर काम करने वाला पाठक ऐसी तालिका देख रहा होता जो ऊपर के पैनल से उलटी बात कहती है। क्रांतिक मान वाला कैलकुलेटर उस खोज की जगह है, और एक और वजह है जिससे यह पेज सिद्धांत में भी तालिका नहीं दिखा सकता: इसकी स्वतंत्रता की कोटि k − 1 है, जहाँ k उतनी है जितनी श्रेणियाँ पाठक ने लिखीं, इसलिए तालिका की कौन-सी पंक्ति लागू होगी यह गिनतियाँ लिखे जाने तक पता ही नहीं चलता।
संदर्भ
- 1.3.6.1. What is a Probability Distribution — e-Handbook of Statistical Methods (a test statistic as a quantity with its own distribution under the null hypothesis, which is what makes the tail area computable) — National Institute of Standards and Technology (NIST)
- 3.1 Terminology — Introductory Statistics 2e (relative frequency as an estimate of a probability, which is the step that turns a category's probability into an expected count of observations) — OpenStax (Rice University)
- 1.3.6.7.1. Cumulative Distribution Function of the Standard Normal Distribution — e-Handbook of Statistical Methods (the same reading of a tail area off a cumulative curve that this page performs with the chi-square curve instead) — National Institute of Standards and Technology (NIST)