कंप्यूटर विज्ञान और डेटा विश्लेषण की दुनिया में डेटा (Data) सबसे महत्वपूर्ण संसाधन है। डेटा तथ्यों और आँकड़ों का संग्रह है जिसे विश्लेषण कर सार्थक जानकारी में बदला जा सकता है। इस अध्याय में हम समझेंगे कि डेटा क्या है, डेटा के प्रकार क्या हैं, डेटा को कैसे वर्गीकृत किया जाता है, और डेटा विज्ञान (Data Science) में इन अवधारणाओं का क्या महत्व है। यह अध्याय डेटा के साथ कार्य करने की नींव तैयार करता है, जो आगे चलकर डेटाबेस, SQL और डेटा विश्लेषण में उपयोगी होता है।
डेटा को समझने का अर्थ केवल उसे संग्रहीत करना नहीं है, बल्कि उसकी प्रकृति, प्रकार, उद्देश्य और विश्वसनीयता को समझना है। जब हम डेटा के प्रकारों को पहचान लेते हैं तो हम उसके अनुसार उपयुक्त विधियों का चयन कर सकते हैं - चाहे वह संख्यात्मक डेटा का सांख्यिकीय विश्लेषण हो या श्रेणीबद्ध डेटा का वर्गीकरण।
डेटा तथ्यों, आँकड़ों, संख्याओं, अक्षरों, चित्रों, ध्वनियों आदि का कच्चा (raw) संग्रह है। डेटा का प्रसंस्करण करने पर ही उसका अर्थ निकलता है। उदाहरण के लिए, "85" एक डेटा बिंदु है, परंतु यह बताने पर कि यह किसी विद्यार्थी के गणित में प्राप्त अंक हैं, यह सूचना (Information) में बदल जाता है। इसी प्रकार, कई विद्यार्थियों के अंकों का विश्लेषण करने पर हमें ज्ञान (Knowledge) प्राप्त होता है कि कौन सा विद्यार्थी अच्छा प्रदर्शन कर रहा है।
डेटा को सूचना और ज्ञान से जोड़ने का क्रम निम्नलिखित है:
डेटा (कच्चे तथ्य) → सूचना (प्रसंस्कृत डेटा) → ज्ञान (सूचना का विश्लेषण)
डेटा को मुख्य रूप से दो श्रेणियों में बाँटा जाता है: गुणात्मक डेटा (Qualitative Data) और मात्रात्मक डेटा (Quantitative Data)।
गुणात्मक डेटा वह डेटा है जो गुणों, विशेषताओं या श्रेणियों का वर्णन करता है। यह संख्याओं में नहीं होता और इसे मापा नहीं जा सकता, केवल वर्गीकृत किया जा सकता है। उदाहरण: रंग (लाल, नीला), लिंग, शहर का नाम, वाहन का प्रकार, पसंदीदा खेल।
मात्रात्मक डेटा वह डेटा है जो संख्याओं में व्यक्त होता है और जिसे मापा जा सकता है। इसे आगे दो भागों में बाँटा जाता है:
डेटा को उसकी संरचना के आधार पर भी वर्गीकृत किया जाता है:
यह डेटा एक निश्चित प्रारूप में संगठित होता है, जैसे तालिकाओं में पंक्तियों और स्तंभों के रूप में। इसे आसानी से खोजा, संसाधित और विश्लेषित किया जा सकता है। उदाहरण: डेटाबेस की तालिकाएँ, स्प्रेडशीट।
| विद्यार्थी | गणित | विज्ञान |
|---|---|---|
| अनु | 85 | 90 |
| रवि | 92 | 88 |
यह डेटा किसी निश्चित प्रारूप में नहीं होता और इसे व्यवस्थित करना कठिन होता है। उदाहरण: पाठ्य दस्तावेज़, चित्र, वीडियो, ऑडियो, सोशल मीडिया पोस्ट।
यह डेटा पूर्ण रूप से संरचित नहीं होता परंतु इसकी कुछ आंतरिक संरचना अवश्य होती है। उदाहरण: JSON फाइलें, XML फाइलें, ईमेल।
{
"नाम": "अनु",
"अंक": 85,
"विषय": "गणित"
}
पाइथन प्रोग्रामिंग में डेटा को विभिन्न प्रकारों में संग्रहीत किया जाता है। NCERT पाठ्यक्रम के अनुसार प्रमुख डेटा प्रकार निम्नलिखित हैं:
# संख्यात्मक डेटा प्रकार
age = 18 # int (पूर्णांक)
price = 99.99 # float (दशमलव)
is_student = True # bool (तार्किक)
# संग्रह डेटा प्रकार
name = "राहुल" # str (स्ट्रिंग)
marks = [85, 90, 78] # list (सूची)
student = ("अनु", 92) # tuple (टपल)
scores = {"गणित": 85} # dict (शब्दकोश)
unique = {1, 2, 3} # set (सेट)
प्रत्येक डेटा प्रकार की अपनी विशेषताएँ होती हैं - सूची परिवर्तनशील (mutable) है, टपल अपरिवर्तनशील (immutable) है, शब्दकोश कुंजी-मूल्य (key-value) जोड़े संग्रहीत करता है।
डेटा का विश्लेषण उसे समझने और उससे निष्कर्ष निकालने की प्रक्रिया है। विश्लेषण में सांख्यिकीय मापों का उपयोग होता है:
marks = [85, 90, 78, 90, 88]
mean = sum(marks) / len(marks)
print("माध्य:", mean) # 86.2
sorted_marks = sorted(marks)
n = len(sorted_marks)
median = sorted_marks[n // 2] if n % 2 else (sorted_marks[n//2 - 1] + sorted_marks[n//2]) / 2
print("माध्यिका:", median) # 88
mode = max(set(marks), key=marks.count)
print("बहुलक:", mode) # 90
import statistics
marks = [85, 90, 78, 90, 88]
print("मानक विचलन:", statistics.stdev(marks))
डेटा विज्ञान एक अंतःविषयक क्षेत्र है जो डेटा से ज्ञान और अंतर्दृष्टि (insight) प्राप्त करने के लिए सांख्यिकी, कंप्यूटर विज्ञान और डोमेन ज्ञान का संयोजन करता है। डेटा विज्ञान की प्रक्रिया के मुख्य चरण:
| प्रकार | विवरण | उदाहरण |
|---|---|---|
| गुणात्मक डेटा | गुण/श्रेणियाँ | रंग, लिंग |
| मात्रात्मक डेटा | मापने योग्य संख्याएँ | ऊँचाई, वजन |
| असतत डेटा | केवल पूर्ण संख्याएँ | परिवार के सदस्य |
| सतत डेटा | कोई भी मान | तापमान, समय |
| प्रकार | संरचना | उदाहरण |
|---|---|---|
| संरचित | तालिका/पंक्तियाँ-स्तंभ | डेटाबेस |
| असंरचित | कोई प्रारूप नहीं | चित्र, वीडियो |
| अर्ध-संरचित | आंशिक संरचना | JSON, XML |
डेटा आधुनिक कंप्यूटिंग का मूल है। डेटा को उसकी प्रकृति (गुणात्मक/मात्रात्मक) और संरचना (संरचित/असंरचित/अर्ध-संरचित) के आधार पर वर्गीकृत किया जाता है। माध्य, माध्यिका और बहुलक जैसे सांख्यिकीय माप डेटा को समझने में सहायक होते हैं। पाइथन में विभिन्न डेटा प्रकार डेटा को संग्रहीत और संसाधित करने के माध्यम प्रदान करते हैं। डेटा विज्ञान की यात्रा कच्चे डेटा से प्रारंभ होकर सूचना, ज्ञान और अंततः बुद्धिमत्ता तक पहुँचती है। इस अध्याय की अवधारणाएँ डेटाबेस और SQL के अध्ययन की नींव हैं, इसलिए इन्हें ध्यान से समझना चाहिए।