Comprehensive theory, key formulas, diagrams, and memory aids for डेटा को समझना.
कंप्यूटर विज्ञान और डेटा विश्लेषण की दुनिया में डेटा (Data) सबसे महत्वपूर्ण संसाधन है। डेटा तथ्यों और आँकड़ों का संग्रह है जिसे विश्लेषण कर सार्थक जानकारी में बदला जा सकता है। इस अध्याय में हम समझेंगे कि डेटा क्या है, डेटा के प्रकार क्या हैं, डेटा को कैसे वर्गीकृत किया जाता है, और डेटा विज्ञान (Data Science) में इन अवधारणाओं का क्या महत्व है। यह अध्याय डेटा के साथ कार्य करने की नींव तैयार करता है, जो आगे चलकर डेटाबेस, SQL और डेटा विश्लेषण में उपयोगी होता है।
डेटा को समझने का अर्थ केवल उसे संग्रहीत करना नहीं है, बल्कि उसकी प्रकृति, प्रकार, उद्देश्य और विश्वसनीयता को समझना है। जब हम डेटा के प्रकारों को पहचान लेते हैं तो हम उसके अनुसार उपयुक्त विधियों का चयन कर सकते हैं - चाहे वह संख्यात्मक डेटा का सांख्यिकीय विश्लेषण हो या श्रेणीबद्ध डेटा का वर्गीकरण।
डेटा तथ्यों, आँकड़ों, संख्याओं, अक्षरों, चित्रों, ध्वनियों आदि का कच्चा (raw) संग्रह है। डेटा का प्रसंस्करण करने पर ही उसका अर्थ निकलता है। उदाहरण के लिए, "85" एक डेटा बिंदु है, परंतु यह बताने पर कि यह किसी विद्यार्थी के गणित में प्राप्त अंक हैं, यह सूचना (Information) में बदल जाता है। इसी प्रकार, कई विद्यार्थियों के अंकों का विश्लेषण करने पर हमें ज्ञान (Knowledge) प्राप्त होता है कि कौन सा विद्यार्थी अच्छा प्रदर्शन कर रहा है।
डेटा को सूचना और ज्ञान से जोड़ने का क्रम निम्नलिखित है:
डेटा (कच्चे तथ्य) → सूचना (प्रसंस्कृत डेटा) → ज्ञान (सूचना का विश्लेषण)
डेटा को मुख्य रूप से दो श्रेणियों में बाँटा जाता है: गुणात्मक डेटा (Qualitative Data) और मात्रात्मक डेटा (Quantitative Data)।
गुणात्मक डेटा वह डेटा है जो गुणों, विशेषताओं या श्रेणियों का वर्णन करता है। यह संख्याओं में नहीं होता और इसे मापा नहीं जा सकता, केवल वर्गीकृत किया जा सकता है। उदाहरण: रंग (लाल, नीला), लिंग, शहर का नाम, वाहन का प्रकार, पसंदीदा खेल।
मात्रात्मक डेटा वह डेटा है जो संख्याओं में व्यक्त होता है और जिसे मापा जा सकता है। इसे आगे दो भागों में बाँटा जाता है:
डेटा को उसकी संरचना के आधार पर भी वर्गीकृत किया जाता है:
यह डेटा एक निश्चित प्रारूप में संगठित होता है, जैसे तालिकाओं में पंक्तियों और स्तंभों के रूप में। इसे आसानी से खोजा, संसाधित और विश्लेषित किया जा सकता है। उदाहरण: डेटाबेस की तालिकाएँ, स्प्रेडशीट।
| विद्यार्थी | गणित | विज्ञान |
|---|---|---|
| अनु | 85 | 90 |
| रवि | 92 | 88 |
यह डेटा किसी निश्चित प्रारूप में नहीं होता और इसे व्यवस्थित करना कठिन होता है। उदाहरण: पाठ्य दस्तावेज़, चित्र, वीडियो, ऑडियो, सोशल मीडिया पोस्ट।
यह डेटा पूर्ण रूप से संरचित नहीं होता परंतु इसकी कुछ आंतरिक संरचना अवश्य होती है। उदाहरण: JSON फाइलें, XML फाइलें, ईमेल।
{
"नाम": "अनु",
"अंक": 85,
"विषय": "गणित"
}
पाइथन प्रोग्रामिंग में डेटा को विभिन्न प्रकारों में संग्रहीत किया जाता है। NCERT पाठ्यक्रम के अनुसार प्रमुख डेटा प्रकार निम्नलिखित हैं:
# संख्यात्मक डेटा प्रकार
age = 18 # int (पूर्णांक)
price = 99.99 # float (दशमलव)
is_student = True # bool (तार्किक)
# संग्रह डेटा प्रकार
name = "राहुल" # str (स्ट्रिंग)
marks = [85, 90, 78] # list (सूची)
student = ("अनु", 92) # tuple (टपल)
scores = {"गणित": 85} # dict (शब्दकोश)
unique = {1, 2, 3} # set (सेट)
प्रत्येक डेटा प्रकार की अपनी विशेषताएँ होती हैं - सूची परिवर्तनशील (mutable) है, टपल अपरिवर्तनशील (immutable) है, शब्दकोश कुंजी-मूल्य (key-value) जोड़े संग्रहीत करता है।
डेटा का विश्लेषण उसे समझने और उससे निष्कर्ष निकालने की प्रक्रिया है। विश्लेषण में सांख्यिकीय मापों का उपयोग होता है:
marks = [85, 90, 78, 90, 88]
mean = sum(marks) / len(marks)
print("माध्य:", mean) # 86.2
sorted_marks = sorted(marks)
n = len(sorted_marks)
median = sorted_marks[n // 2] if n % 2 else (sorted_marks[n//2 - 1] + sorted_marks[n//2]) / 2
print("माध्यिका:", median) # 88
mode = max(set(marks), key=marks.count)
print("बहुलक:", mode) # 90
import statistics
marks = [85, 90, 78, 90, 88]
print("मानक विचलन:", statistics.stdev(marks))
डेटा विज्ञान एक अंतःविषयक क्षेत्र है जो डेटा से ज्ञान और अंतर्दृष्टि (insight) प्राप्त करने के लिए सांख्यिकी, कंप्यूटर विज्ञान और डोमेन ज्ञान का संयोजन करता है। डेटा विज्ञान की प्रक्रिया के मुख्य चरण:
| प्रकार | विवरण | उदाहरण |
|---|---|---|
| गुणात्मक डेटा | गुण/श्रेणियाँ | रंग, लिंग |
| मात्रात्मक डेटा | मापने योग्य संख्याएँ | ऊँचाई, वजन |
| असतत डेटा | केवल पूर्ण संख्याएँ | परिवार के सदस्य |
| सतत डेटा | कोई भी मान | तापमान, समय |
| प्रकार | संरचना | उदाहरण |
|---|---|---|
| संरचित | तालिका/पंक्तियाँ-स्तंभ | डेटाबेस |
| असंरचित | कोई प्रारूप नहीं | चित्र, वीडियो |
| अर्ध-संरचित | आंशिक संरचना | JSON, XML |
flowchart TD
A["डेटा"] --> B["प्रकृति के आधार पर"]
A --> C["संरचना के आधार पर"]
A --> D["विश्लेषण"]
B --> B1["गुणात्मक"]
B --> B2["मात्रात्मक"]
B2 --> B21["असतत"]
B2 --> B22["सतत"]
C --> C1["संरचित"]
C --> C2["असंरचित"]
C --> C3["अर्ध-संरचित"]
D --> D1["माध्य, माध्यिका, बहुलक"]
D --> D2["परास, मानक विचलन"]
डेटा आधुनिक कंप्यूटिंग का मूल है। डेटा को उसकी प्रकृति (गुणात्मक/मात्रात्मक) और संरचना (संरचित/असंरचित/अर्ध-संरचित) के आधार पर वर्गीकृत किया जाता है। माध्य, माध्यिका और बहुलक जैसे सांख्यिकीय माप डेटा को समझने में सहायक होते हैं। पाइथन में विभिन्न डेटा प्रकार डेटा को संग्रहीत और संसाधित करने के माध्यम प्रदान करते हैं। डेटा विज्ञान की यात्रा कच्चे डेटा से प्रारंभ होकर सूचना, ज्ञान और अंततः बुद्धिमत्ता तक पहुँचती है। इस अध्याय की अवधारणाएँ डेटाबेस और SQL के अध्ययन की नींव हैं, इसलिए इन्हें ध्यान से समझना चाहिए।