🔬
🧬
🔭
🪐
🧪
← डैशबोर्ड पर वापस जाएँ
Font Size:

1. परिचय

कंप्यूटर विज्ञान और डेटा विश्लेषण की दुनिया में डेटा (Data) सबसे महत्वपूर्ण संसाधन है। डेटा तथ्यों और आँकड़ों का संग्रह है जिसे विश्लेषण कर सार्थक जानकारी में बदला जा सकता है। इस अध्याय में हम समझेंगे कि डेटा क्या है, डेटा के प्रकार क्या हैं, डेटा को कैसे वर्गीकृत किया जाता है, और डेटा विज्ञान (Data Science) में इन अवधारणाओं का क्या महत्व है। यह अध्याय डेटा के साथ कार्य करने की नींव तैयार करता है, जो आगे चलकर डेटाबेस, SQL और डेटा विश्लेषण में उपयोगी होता है।

डेटा को समझने का अर्थ केवल उसे संग्रहीत करना नहीं है, बल्कि उसकी प्रकृति, प्रकार, उद्देश्य और विश्वसनीयता को समझना है। जब हम डेटा के प्रकारों को पहचान लेते हैं तो हम उसके अनुसार उपयुक्त विधियों का चयन कर सकते हैं - चाहे वह संख्यात्मक डेटा का सांख्यिकीय विश्लेषण हो या श्रेणीबद्ध डेटा का वर्गीकरण।

2. डेटा क्या है? (What is Data?)

डेटा तथ्यों, आँकड़ों, संख्याओं, अक्षरों, चित्रों, ध्वनियों आदि का कच्चा (raw) संग्रह है। डेटा का प्रसंस्करण करने पर ही उसका अर्थ निकलता है। उदाहरण के लिए, "85" एक डेटा बिंदु है, परंतु यह बताने पर कि यह किसी विद्यार्थी के गणित में प्राप्त अंक हैं, यह सूचना (Information) में बदल जाता है। इसी प्रकार, कई विद्यार्थियों के अंकों का विश्लेषण करने पर हमें ज्ञान (Knowledge) प्राप्त होता है कि कौन सा विद्यार्थी अच्छा प्रदर्शन कर रहा है।

डेटा को सूचना और ज्ञान से जोड़ने का क्रम निम्नलिखित है:

डेटा (कच्चे तथ्य) → सूचना (प्रसंस्कृत डेटा) → ज्ञान (सूचना का विश्लेषण)

डेटा के स्रोत:

  1. संवेदक (Sensors): मौसम स्टेशन, स्मार्टफोन आदि।
  2. सर्वेक्षण और प्रश्नावली: जनमत, बाजार अनुसंधान।
  3. ट्रांज़ैक्शन रिकॉर्ड: बैंक लेनदेन, ऑनलाइन खरीदारी।
  4. सोशल मीडिया: पोस्ट, टिप्पणियाँ, लाइक।
  5. चिकित्सा रिकॉर्ड: स्वास्थ्य डेटा, रोग रिकॉर्ड।
  6. शैक्षिक रिकॉर्ड: परीक्षा परिणाम, उपस्थिति।

3. डेटा के प्रकार (Types of Data)

डेटा को मुख्य रूप से दो श्रेणियों में बाँटा जाता है: गुणात्मक डेटा (Qualitative Data) और मात्रात्मक डेटा (Quantitative Data)

3.1 गुणात्मक डेटा (Qualitative Data)

गुणात्मक डेटा वह डेटा है जो गुणों, विशेषताओं या श्रेणियों का वर्णन करता है। यह संख्याओं में नहीं होता और इसे मापा नहीं जा सकता, केवल वर्गीकृत किया जा सकता है। उदाहरण: रंग (लाल, नीला), लिंग, शहर का नाम, वाहन का प्रकार, पसंदीदा खेल।

3.2 मात्रात्मक डेटा (Quantitative Data)

मात्रात्मक डेटा वह डेटा है जो संख्याओं में व्यक्त होता है और जिसे मापा जा सकता है। इसे आगे दो भागों में बाँटा जाता है:

  1. असतत डेटा (Discrete Data): यह केवल पूर्ण संख्याओं में होता है और इसमें अंतरालों के बीच मान संभव नहीं होते। उदाहरण: परिवार में सदस्यों की संख्या, एक कक्षा में विद्यार्थियों की संख्या, पासे पर आने वाली संख्या (केवल 1 से 6)।
  2. सतत डेटा (Continuous Data): यह किसी भी मान को ले सकता है, जिसमें दशमलव मान भी शामिल हैं। उदाहरण: ऊँचाई, वजन, तापमान, समय।

4. डेटा का वर्गीकरण (Classification of Data)

डेटा को उसकी संरचना के आधार पर भी वर्गीकृत किया जाता है:

4.1 संरचित डेटा (Structured Data)

यह डेटा एक निश्चित प्रारूप में संगठित होता है, जैसे तालिकाओं में पंक्तियों और स्तंभों के रूप में। इसे आसानी से खोजा, संसाधित और विश्लेषित किया जा सकता है। उदाहरण: डेटाबेस की तालिकाएँ, स्प्रेडशीट।

विद्यार्थी गणित विज्ञान
अनु 85 90
रवि 92 88

4.2 असंरचित डेटा (Unstructured Data)

यह डेटा किसी निश्चित प्रारूप में नहीं होता और इसे व्यवस्थित करना कठिन होता है। उदाहरण: पाठ्य दस्तावेज़, चित्र, वीडियो, ऑडियो, सोशल मीडिया पोस्ट।

4.3 अर्ध-संरचित डेटा (Semi-structured Data)

यह डेटा पूर्ण रूप से संरचित नहीं होता परंतु इसकी कुछ आंतरिक संरचना अवश्य होती है। उदाहरण: JSON फाइलें, XML फाइलें, ईमेल।

{
  "नाम": "अनु",
  "अंक": 85,
  "विषय": "गणित"
}

5. पाइथन में डेटा प्रकार (Data Types in Python)

पाइथन प्रोग्रामिंग में डेटा को विभिन्न प्रकारों में संग्रहीत किया जाता है। NCERT पाठ्यक्रम के अनुसार प्रमुख डेटा प्रकार निम्नलिखित हैं:

# संख्यात्मक डेटा प्रकार
age = 18                  # int (पूर्णांक)
price = 99.99             # float (दशमलव)
is_student = True         # bool (तार्किक)

# संग्रह डेटा प्रकार
name = "राहुल"            # str (स्ट्रिंग)
marks = [85, 90, 78]      # list (सूची)
student = ("अनु", 92)     # tuple (टपल)
scores = {"गणित": 85}     # dict (शब्दकोश)
unique = {1, 2, 3}        # set (सेट)

प्रत्येक डेटा प्रकार की अपनी विशेषताएँ होती हैं - सूची परिवर्तनशील (mutable) है, टपल अपरिवर्तनशील (immutable) है, शब्दकोश कुंजी-मूल्य (key-value) जोड़े संग्रहीत करता है।

6. डेटा का विश्लेषण (Data Analysis)

डेटा का विश्लेषण उसे समझने और उससे निष्कर्ष निकालने की प्रक्रिया है। विश्लेषण में सांख्यिकीय मापों का उपयोग होता है:

6.1 केन्द्रीय प्रवृत्ति के माप (Measures of Central Tendency)

  1. माध्य (Mean): सभी मानों का औसत। माध्य = मानों का योग ÷ मानों की संख्या।
  2. माध्यिका (Median): सॉर्ट किए मानों का मध्य मान।
  3. बहुलक (Mode): सबसे अधिक बार आने वाला मान।
marks = [85, 90, 78, 90, 88]
mean = sum(marks) / len(marks)
print("माध्य:", mean)   # 86.2

sorted_marks = sorted(marks)
n = len(sorted_marks)
median = sorted_marks[n // 2] if n % 2 else (sorted_marks[n//2 - 1] + sorted_marks[n//2]) / 2
print("माध्यिका:", median)  # 88

mode = max(set(marks), key=marks.count)
print("बहुलक:", mode)   # 90

6.2 प्रसार के माप (Measures of Dispersion)

  1. परास (Range): अधिकतम और न्यूनतम मान का अंतर।
  2. प्रसरण (Variance): मानों का माध्य से औसत विचलन।
  3. मानक विचलन (Standard Deviation): प्रसरण का वर्गमूल।
import statistics
marks = [85, 90, 78, 90, 88]
print("मानक विचलन:", statistics.stdev(marks))

7. डेटा विज्ञान (Data Science) का परिचय

डेटा विज्ञान एक अंतःविषयक क्षेत्र है जो डेटा से ज्ञान और अंतर्दृष्टि (insight) प्राप्त करने के लिए सांख्यिकी, कंप्यूटर विज्ञान और डोमेन ज्ञान का संयोजन करता है। डेटा विज्ञान की प्रक्रिया के मुख्य चरण:

  1. डेटा संग्रह (Data Collection): विभिन्न स्रोतों से डेटा एकत्र करना।
  2. डेटा सफाई (Data Cleaning): अनुपलब्ध या गलत डेटा को सुधारना।
  3. डेटा विश्लेषण (Data Analysis): पैटर्न खोजना।
  4. मॉडल निर्माण (Model Building): भविष्यवाणी के लिए मॉडल बनाना।
  5. परिणाम की व्याख्या (Interpretation): निष्कर्ष प्रस्तुत करना।

त्वरित पुनरावृत्ति तालिकाएँ

डेटा के प्रकार

प्रकार विवरण उदाहरण
गुणात्मक डेटा गुण/श्रेणियाँ रंग, लिंग
मात्रात्मक डेटा मापने योग्य संख्याएँ ऊँचाई, वजन
असतत डेटा केवल पूर्ण संख्याएँ परिवार के सदस्य
सतत डेटा कोई भी मान तापमान, समय

संरचना के आधार पर डेटा

प्रकार संरचना उदाहरण
संरचित तालिका/पंक्तियाँ-स्तंभ डेटाबेस
असंरचित कोई प्रारूप नहीं चित्र, वीडियो
अर्ध-संरचित आंशिक संरचना JSON, XML

माइंड मैप

flowchart TD A["डेटा"] --> B["प्रकृति के आधार पर"] A --> C["संरचना के आधार पर"] A --> D["विश्लेषण"] B --> B1["गुणात्मक"] B --> B2["मात्रात्मक"] B2 --> B21["असतत"] B2 --> B22["सतत"] C --> C1["संरचित"] C --> C2["असंरचित"] C --> C3["अर्ध-संरचित"] D --> D1["माध्य, माध्यिका, बहुलक"] D --> D2["परास, मानक विचलन"]

महत्वपूर्ण आरेख (SVG)

आरेख 1: डेटा के प्रकारों का वर्गीकरण

डेटा गुणात्मक (Qualitative) मात्रात्मक (Quantitative) गुणों का वर्णन रंग, लिंग, शहर,\nपसंदीदा खेल असतत पूर्ण संख्याएँ\nजैसे: सदस्यों की संख्या सतत कोई भी मान\nजैसे: तापमान स्वर्ण नियम: डेटा प्रकार पहचानें, फिर विधि चुनें

आरेख 2: डेटा से ज्ञान तक की यात्रा

डेटा कच्चे तथ्य सूचना प्रसंस्कृत डेटा ज्ञान विश्लेषित सूचना बुद्धिमत्ता निर्णय लेने की क्षमता संग्रह प्रसंस्करण विश्लेषण निर्णय उदाहरण डेटा: विद्यार्थियों के अंकों की सूची सूचना: कुल औसत अंक 86.2 है स्वर्ण नियम: डेटा प्रसंस्करण से सार्थक सूचना बनती है

सामान्य गलतियाँ

  1. गुणात्मक और मात्रात्मक डेटा को भ्रमित करना: रंग और लिंग गुणात्मक हैं, ऊँचाई और वजन मात्रात्मक हैं। यह अंतर वस्तुनिष्ठ प्रश्नों में सबसे अधिक पूछा जाता है।
  2. असतत और सतत डेटा में अंतर न समझना: असतत डेटा केवल पूर्ण संख्याओं में होता है (जैसे परिवार के सदस्य), सतत डेटा दशमलव मान भी ले सकता है।
  3. माध्य, माध्यिका और बहुलक में भ्रम: माध्य औसत है, माध्यिका मध्य मान है, बहुलक सबसे बार-बार आने वाला मान है।
  4. संरचित और असंरचित डेटा को गलत समझना: डेटाबेस तालिका संरचित है, जबकि चित्र/वीडियो असंरचित हैं।
  5. डेटा को सूचना से तुलना करना: दोनों अलग हैं - डेटा कच्चा है, सूचना प्रसंस्कृत है।
  6. पाइथन डेटा प्रकारों के गुण भूलना: सूची परिवर्तनशील है, टपल अपरिवर्तनशील है - इन्हें अलग-अलग समझें।

परीक्षा युक्तियाँ

  1. हर डेटा प्रकार (गुणात्मक/मात्रात्मक, असतत/सतत) के 2-3 उदाहरण याद रखें।
  2. माध्य, माध्यिका और बहुलक की गणना के प्रश्नों का अभ्यास करें।
  3. संरचित, असंरचित और अर्ध-संरचित डेटा के उदाहरणों की तालिका तैयार रखें।
  4. पाइथन में विभिन्न डेटा प्रकारों (int, float, str, list, tuple, dict, set) की पहचान के कोड-आधारित प्रश्न हल करें।
  5. डेटा → सूचना → ज्ञान का क्रम समझाइए, यह अक्सर परीक्षा में पूछा जाता है।
  6. परास = अधिकतम - न्यूनतम का सूत्र याद रखें।

निष्कर्ष

डेटा आधुनिक कंप्यूटिंग का मूल है। डेटा को उसकी प्रकृति (गुणात्मक/मात्रात्मक) और संरचना (संरचित/असंरचित/अर्ध-संरचित) के आधार पर वर्गीकृत किया जाता है। माध्य, माध्यिका और बहुलक जैसे सांख्यिकीय माप डेटा को समझने में सहायक होते हैं। पाइथन में विभिन्न डेटा प्रकार डेटा को संग्रहीत और संसाधित करने के माध्यम प्रदान करते हैं। डेटा विज्ञान की यात्रा कच्चे डेटा से प्रारंभ होकर सूचना, ज्ञान और अंततः बुद्धिमत्ता तक पहुँचती है। इस अध्याय की अवधारणाएँ डेटाबेस और SQL के अध्ययन की नींव हैं, इसलिए इन्हें ध्यान से समझना चाहिए।