1. Über Big Data
- Προβολή
Big Data bezeichnet eine enorme Menge an Informationsdaten, deren Volumen spezifische Analysemethoden und Technologien für Forschungszwecke jeglicher Art erfordert. Die drei grundlegenden Merkmale dieser Informationsmengen – die sogenannten drei Vs – sind:
- Volumen. Es handelt sich hierbei um besonders umfangreiche Daten, was bedeutet, dass sie sehr viel Speicherplatz beanspruchen können, beginnend im Bereich von Terabytes bis hin zu Petabytes;
- Geschwindigkeit. Obwohl die Datenmenge besonders groß ist, müssen die Daten in möglichst kurzer Zeit entschlüsselt und gelesen werden. Der entscheidende Faktor für die Handhabung und das korrekte Management von Big Data ist daher die Geschwindigkeit.
- Vielfalt. Big Data werden als unstrukturierte oder semi-strukturierte Daten definiert, was eine zusätzliche Schwierigkeit darstellt, da eine Vorabanalyse erforderlich ist, bevor sie verarbeitet werden können.
In jüngerer Zeit wurden den drei Vs weitere Merkmale hinzugefügt:
- Wahrhaftigkeit: Damit Big Data korrekt verarbeitet werden können, müssen sie gefiltert werden; da es sich um Rohdaten handelt, können sie zu falschen Analysen und einem hohen Risiko statistischer Fehler und Fehlinterpretationen führen.
- Wert: Nicht alle Big Data haben einen Wert, abhängig vom Zweck, für den sie verarbeitet und interpretiert werden. Auch hier sollten die relevanten Daten vor der Analyse ausgewählt werden.
- Variabilität: Sie können gefiltert, kategorisiert und je nach Verwendungszweck unterschiedlich genutzt werden.
Im Allgemeinen gibt es drei Arten von Daten: strukturierte, semi-strukturierte und unstrukturierte Daten. Es muss jedoch betont werden, dass Daten und Informationen nicht synonym sind, denn – insbesondere in der Informatik – existieren Informationen nicht per se, sondern werden erst durch die Verarbeitung der gesammelten Daten gewonnen.
Wenn wir von strukturierten Daten sprechen, meinen wir eine Art von Information, die leicht in Datenfelder gekapselt und organisiert werden kann, da sie durch eine präzise Struktur gekennzeichnet ist; als Beispiel kann man sich eine Tabelle wie diese vorstellen, die drei verschiedene Spalten mit Feldern enthält:
|
NAME |
NACHNAME |
IDENTIFIKATIONSCODE |
|
Mario |
Rossi |
000000000001 |
Wenn wir von semi-strukturierten Daten sprechen, beziehen wir uns auf eine Art von Information, von der ein Teil in Datenfeldern gekapselt werden kann – und somit strukturierte Daten sind – während ein anderer Teil aus unstrukturierten Daten besteht; ein typisches Beispiel sind E-Mails, bei denen einige Felder vordefiniert sind, wie der Absender, der Empfänger und der Betreff, während der eigentliche Text der E-Mail – also die Nachricht, die wir versenden – in Form von unstrukturierten Daten vorliegt, da sie nicht in ein bestimmtes Feld gekapselt werden kann.
Abbildung 1 – Klassifizierung von Daten innerhalb einer E-Mail
Im Hinblick auf Big Data handelt es sich um unstrukturierte, semi-strukturierte und strukturierte Daten.