Comprehensive theory, key formulas, diagrams, and memory aids for आँकड़ों का संग्रहण (Collection of Data).
किसी भी सांख्यिकीय अध्ययन की सबसे पहली और महत्वपूर्ण प्रक्रिया आँकड़ों का संग्रहण है। यदि आँकड़े सही नहीं हैं तो उनके आधार पर निकाले गए निष्कर्ष भी गलत होंगे। आँकड़ों के संग्रहण के विभिन्न स्रोत और विधियाँ होती हैं। यह अध्याय आँकड़ों के स्रोतों, संग्रहण की विधियों, प्रश्नावली, जनगणना, नमूना सर्वेक्षण और त्रुटियों की विस्तृत चर्चा करता है।
आँकड़ों के मुख्य रूप से दो स्रोत होते हैं: - प्राथमिक स्रोत (Primary Source): वे आँकड़े जिन्हें संग्राहक अपने विशिष्ट उद्देश्य के लिए पहली बार स्वयं एकत्र करता है। - द्वितीयक स्रोत (Secondary Source): वे आँकड़े जो पहले किसी अन्य संस्था या व्यक्ति द्वारा एकत्र किए जा चुके होते हैं और अन्य उद्देश्य के लिए उपलब्ध होते हैं। इनके उदाहरण हैं - प्रकाशित या अप्रकाशित स्रोत, जैसे सरकारी रिपोर्ट, अंतर्राष्ट्रीय पत्रिकाएँ, अनुसंधान संस्थानों के प्रकाशन, पिछली सर्वेक्षण रिपोर्टें आदि।
आँकड़े एकत्र करने की दो मुख्य विधियाँ हैं:
इस विधि में जनसंख्या (विश्व) की प्रत्येक इकाई से आँकड़े एकत्र किए जाते हैं। इसमें किसी भी इकाई को छोड़ा नहीं जाता। - लाभ: पूर्ण विश्वसनीय, सटीक, व्यापक विवरण मिलता है; प्रत्येक इकाई का अध्ययन। - हानियाँ: अत्यधिक खर्चीली, समय लेने वाली, बड़ी संख्या में प्रशिक्षित कर्मचारियों की आवश्यकता।
इस विधि में संपूर्ण जनसंख्या (विश्व) के प्रतिनिधि के रूप में कुछ चुनिंदा इकाइयों (नमूने) से आँकड़े एकत्र किए जाते हैं और इनके आधार पर संपूर्ण विश्व के बारे में निष्कर्ष निकाले जाते हैं। - लाभ: कम खर्चीला, कम समय लेने वाला, कम कर्मचारियों की आवश्यकता, उच्च गुणवत्ता वाले आँकड़े। - हानियाँ: यदि नमूना प्रतिनिधि नहीं है तो निष्कर्ष भ्रामक हो सकते हैं।
प्राथमिक आँकड़ों का संग्रहण प्रायः प्रश्नावली या अनुसूची के माध्यम से किया जाता है। ये मुद्रित रूप में प्रश्नों की सूची होती हैं जिनके उत्तर उत्तरदाता से प्राप्त किए जाते हैं।
सांख्यिकीय त्रुटियाँ मुख्यतः दो प्रकार की होती हैं: - नमूना त्रुटियाँ (Sampling Errors): ये त्रुटियाँ तब उत्पन्न होती हैं जब नमूना पूर्ण विश्व का सटीक प्रतिनिधित्व नहीं करता। ये त्रुटियाँ नमूने के आकार, नमूना लेने की विधि, चर की विषमता आदि पर निर्भर करती हैं। नमूने का आकार बढ़ाने पर ये घटती हैं। - गैर-नमूना त्रुटियाँ (Non-sampling Errors): ये त्रुटियाँ नमूना लेने के अतिरिक्त अन्य कारणों से उत्पन्न होती हैं, जैसे गलत प्रश्नावली, प्रश्नों का अस्पष्ट होना, उत्तरदाता की लापरवाही, डेटा संकलन में गलतियाँ, लेखन की गलतियाँ आदि। ये त्रुटियाँ नमूने का आकार बढ़ाने पर भी कम नहीं होतीं।
नमूनाकरण की विधियों में साधारण यादृच्छिक नमूनाकरण सबसे सरल है। इसमें प्रत्येक इकाई को चुने जाने का समान और स्वतंत्र अवसर प्राप्त होता है। चयन लॉटरी पद्धति, रैंडम नंबर टेबल आदि द्वारा किया जाता है। प्रत्येक संभव नमूने के चुने जाने की संभावना समान होती है।
इस विधि में जनसंख्या को पहले कुछ सजातीय समूहों (स्तरों) में विभाजित किया जाता है और फिर प्रत्येक स्तर से यादृच्छिक रूप से इकाइयाँ चुनी जाती हैं। यह तब उपयोगी है जब जनसंख्या विषम हो। इससे अधिक प्रतिनिधि नमूना प्राप्त होता है और नमूना त्रुटि कम होती है।
graph TD
A["आँकड़ों का संग्रहण"] --> B["प्राथमिक स्रोत"]
A --> C["द्वितीयक स्रोत"]
B --> D["विधियाँ: जनगणना या नमूना सर्वेक्षण"]
C --> E["प्रकाशित/अप्रकाशित स्रोत"]
D --> F["प्रश्नावली/अनुसूची"]
F --> G["साक्षात्कार, डाक, टेलीफोन, प्रत्यक्ष अवलोकन"]
| आधार | जनगणना | नमूना सर्वेक्षण |
|---|---|---|
| अध्ययन की इकाइयाँ | संपूर्ण विश्व | प्रतिनिधि नमूना |
| लागत | अत्यधिक | कम |
| समय | अधिक | कम |
| विश्वसनीयता | उच्च (यदि सही क्रियान्वयन) | नमूने की प्रतिनिधिकता पर निर्भर |
| त्रुटियाँ | गैर-नमूना त्रुटियाँ अधिक | नमूना त्रुटियाँ विद्यमान |
| आधार | नमूना त्रुटि | गैर-नमूना त्रुटि |
|---|---|---|
| कारण | नमूना संपूर्ण विश्व का प्रतिनिधि नहीं | डेटा संग्रहण की त्रुटियाँ |
| नमूना आकार पर प्रभाव | आकार बढ़ाने पर घटती है | आकार बढ़ाने पर नहीं घटती |
| नियंत्रण | स्तरीकरण से कम की जा सकती है | सावधानीपूर्वक संग्रहण से कम की जा सकती है |
graph TD
A["आँकड़ों का संग्रहण"] --> B["स्रोत"]
B --> C["प्राथमिक"]
B --> D["द्वितीयक"]
A --> E["विधियाँ"]
E --> F["जनगणना"]
E --> G["नमूना सर्वेक्षण"]
G --> H["यादृच्छिक नमूनाकरण"]
G --> I["स्तरीकृत यादृच्छिक"]
A --> J["प्रश्नावली/अनुसूची"]
A --> K["त्रुटियाँ"]
K --> L["नमूना त्रुटि"]
K --> M["गैर-नमूना त्रुटि"]
आँकड़ों का संग्रहण सांख्यिकीय अध्ययन की नींव है। सही स्रोत, उपयुक्त विधि (जनगणना या नमूना सर्वेक्षण) और सावधानीपूर्वक निर्मित प्रश्नावली ही विश्वसनीय आँकड़े प्रदान कर सकते हैं। नमूना सर्वेक्षण की लोकप्रियता बढ़ती जा रही है, परंतु सही नमूनाकरण विधि का चयन आवश्यक है। त्रुटियों (नमूना और गैर-नमूना) की पहचान और उन्हें कम करने के उपाय भी इसी चरण में किए जाते हैं। अगले अध्याय में हम एकत्रित आँकड़ों को संगठित करने (वर्गीकरण और सारणीयन) का अध्ययन करेंगे।