+ All Categories
Home > Documents > Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map...

Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map...

Date post: 06-Apr-2015
Category:
Upload: gitta-woertz
View: 103 times
Download: 0 times
Share this document with a friend
92
Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to Peer Informationssysteme No SQL Systeme Multi-Tenancy/Cloud-Datenbanken
Transcript
Page 1: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Big Data

• Top-k / Ranking / Skyline• Semantic Web: RDF• Information Retrieval• PageRank / HITS

• Map Reduce: Massiv parallele Verarbeitung• Datenströme• Peer to Peer Informationssysteme• No SQL Systeme

• Multi-Tenancy/Cloud-Datenbanken

Page 2: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.
Page 3: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Weitere Decision-Support Anfrage-Typen Top N-Anfragen

Ich will nur die N besten Treffer erhalten und ncht alle 5 Millionen

Muss bei der Anfrageoptimierung berücksichtigt werden

Online AggregationMan berechnet das Ergebnis approximativ Je länger die Anfrage läuft, desto genauer wird das

Ergebnis

Page 4: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Top N-AnfragenSelect A.*From Angestellte A, Abteilungen abtWhere A.Abteilung = abt.AbteilungsNr and abt.Ort =

PassauOrder by A.GehaltStop after 20

Page 5: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Top N-Anfragen auf Verteilten Datenquellen

Page 6: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Ranking in DB2

Page 7: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.
Page 8: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Ranking innerhalb von Untergruppen

Page 9: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Threshold-Algorithmus zur Auswertung von Top-n-Anfragen (3)

Page 10: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Threshold-Algorithmus zur Auswertung von Top-n-Anfragen (3)

Page 11: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Threshold-Algorithmus zur Auswertung von Top_n-Anfragen

Page 12: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

No-Random-Access-Algorithmus

Page 13: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

No-Random-Access-Algorithmus

Page 14: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Skyline / Pareto-Optimum

Page 15: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Skyline in SQL

Page 16: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Skyline in Standard-SQL

Page 17: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Online-AggregationSelect abt.Ort, avg(A.Gehalt)From Angestellte A, Abteilungen abtWhere A.Abteilung = abt.AbteilungsNrGroup by abt.Ort

Page 18: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Semantic Web: Resource Description Framework (RDF)

Triple-Datenmodell

(Subjekt, Prädikat, Objekt)

Meist graphische Visualisierung Subjekte und Objekte sind KnotenPrädikate sind gerichtete Kanten

Von Subjekt-Knoten nach Objekt Knoten

Page 19: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Beispiel-RDF-Graph

Page 20: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Textuelle Darstellung des Graphen

Page 21: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Kurzform

Page 22: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Namenlose Knoten

Page 23: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Graph mit unbenannten Knoten

Page 24: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF AnfragespracheSELECT ?Var1 ?Var2 … $VarNWHERE {Muster1. Muster2. … MusterM. }

PREFIX ex: <http://www.example.org>

SELECT ?AutorenDesOldenbourgVerlags WHERE{ ?buch ex:Autor ?a. ?a ex:NachName ?AutorenDesOldenbourgVerlags. ?buch ex:verlegtBei

<http://oldenbourg-verlag.de/wissenschaftsverlag>.}

Page 25: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF AnfragesprachePREFIX ex: <http://www.example.org>

SELECT ?KempersBuecherTitel WHERE{ ?KempersBuecher ex:Autor ?k. ?k ex:NachName "Kemper". ?KempersBuecher ex:Titel ?KempersBuecherTitel.}

Page 26: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF AnfragespracheUnionPREFIX ex: <http://www.example.org>

SELECT ?KempersOderEicklersBuecherTitel WHERE{ { ?KempersBuecher ex:Autor ?k. ?k ex:NachName "Kemper". ?KempersBuecher ex:Titel ?

KempersOderEicklersBuecherTitel. } UNION { ?EicklersBuecher ex:Autor ?k. ?k ex:NachName "Eickler". ?EicklersBuecher ex:Titel ?

KempersOderEicklersBuecherTitel.} }

Page 27: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF AnfragespracheoptionalPREFIX ex: <http://www.example.org>

SELECT ?KempersBuecherTitel ?KempersBuecherISBN WHERE

{ ?KempersBuecher ex:Autor ?k. ?k ex:NachName "Kemper". ?KempersBuecher ex:Titel ?KempersBuecherTitel. OPTIONAL { ?KempersBuecher ex:hatISBN ?

KempersBuecherISBN }}

Page 28: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF Anfragesprachefilter

Page 29: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

SPARQL: Die RDF Anfragesprachecount-AggregationPREFIX ex: <http://www.example.org>

SELECT COUNT ?verlag WHERE{ ?buch ex:verlegtBei ?verlag.}

Für SQL-affine Leser ist diese Anfrage etwas gewöhnungsbedürftig, da man ja in der Tat die Bücher zählen will. Die SPARQL-Formulierung zielt aber darauf ab, die Anzahl der Vorkommnisse des Musters „?buch ex:verlegtBei ?verlag“ für jeden ?verlag zu zählen.

Page 30: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.
Page 31: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Implementierung einer RDF-Datenbank: RDF-3X

Page 32: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

B-Bäume … so viele wie möglich

Page 33: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Kompressionstechnik: Dictionary und Präfix Jedes Tripel $(s,p,o)$ wird also genau 6 mal repliziert

abgelegt -- allerdings in permutierter Subjekt/Prädikat/Objekt-Reihenfolge, nämlich $(p,s,o)$, $(s,p,o)$, $(p,o,s)$, $(o,s,p)$, $(s,o,p)$

und $(o,p,s)$. Zusätzlich gibt es noch die sogenannten aggregierten

Indexe, die die Anzahl der Vorkommen des jeweiligen Musters repräsentieren. Zum Beispiel bedeutet der Eintrag $(s,o,7)$, dass das Subjekt s siebenmal mit dem Objekt o in einer Beziehung steht -- mit beliebigem Prädikat.

Das Speichervolumen wird dadurch (dramatisch) reduziert, dass man in den Blättern der Bäume eine Präfix-Komprimierung durchführt. Z.B. wird in dem zweiten Eintrag des SPO-Baums das Subjekt 0 weggelassen, da es identisch zum ersten Eintrag ist. In dem vierten Eintrag kann sogar die Subjekt- und die Prädikat-Kennung weggelassen werden, da beide identisch zum dritten Eintrag sind

Page 34: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Kompressionstechnik: Dictionary und Präfix Es werden aber nicht nur gleiche Präfixe weggelassen;

zusätzlich wird auch anstatt des jeweiligen Codes nur die Differenz zum Code des Vorgänger-Tripels gespeichert. Der letzte Eintrag im SPO-Baum würde demnach als (-,1,1) gespeichert, da er in der ersten Komponente identisch zum Vorgänger-Tripel ist, in der zweiten und dritten Komponente ist die Differenz zum Vorgänger-Tripel jeweils 1.

Diese Kompression ist sehr effektiv, da die Tripel in den Blattknoten ja fortlaufend sortiert sind und sich deshalb immer nur geringfügig vom Vorgänger-Tripel unterscheiden.

Als Anker für diese Differenz-Kompression wird auf jeder Blatt-Seite immer nur ein vollständiges Tripel, nämlich das Erste, gespeichert.

Page 35: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

AnfrageauswertungPREFIX ex: <http://www.example.org>

SELECT REDUCED ?AutorenDesOldenbourgVerlags WHERE{ ?buch ex:Autor ?a. ?a ex:NachName ?AutorenDesOldenbourgVerlags. ?buch ex:verlegtBei

<http://oldenbourg-verlag.de/wissenschaftsverlag>.}

SELECT REDUCED ?AutorenDesOldenbourgVerlags WHERE{ ?buch 7 ?a. ?a 11 ?AutorenDesOldenbourgVerlags. ?buch 3 4.}

Dict-Lookup

Page 36: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Merge-Joins … so weit das Auge reicht …

Page 37: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Datenströme

Page 38: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Datenbank versus Datenstrom

Page 39: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Beispiel-Datenstrom

Page 40: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Datenstrom-Definition und einfache Anfrage

Page 41: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Subskriptions-Anfrage

Page 42: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Prädikat-Index

Page 43: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Bereichsanfrage

Page 44: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

R-Baum-Index

Page 45: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Fenster-Anfrage

Page 46: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Auswertung: Short Auctions

Page 47: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Sliding Windows

Page 48: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Überlappende Fenster

Page 49: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Hot Items-Anfrage

Page 50: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Auswertung: Hot Item

Page 51: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Information Retrieval Informationsexplosion im Internet

Ranking von Dokumenten um relevante Information zu finden

Ähnlichkeit von Dokumenten (Dissertationen) zu erkennen

Page 52: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

TF-IDF: Term Frequency – Inverse Document Frequency

Page 53: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Relevanz-Ranking am Beispiel

Page 54: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Relevanz-Ranking am Beispiel

Page 55: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Invertierte Indexierung

Page 56: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Page Rank: Grundidee

Page 57: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Page Rank: Grundidee

Page 58: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Mathematisches Modell des PageRank

Page 59: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Mathematisches Modell des PageRank: unser Beispiel

Page 60: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Konvergenz und Dämpfung

Page 61: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

PageRank für größeren Graph [aus Wikipedia]

Page 62: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

HITS-Algorithmus: Hubs und Autoritäten

Page 63: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

HITS-Algorithmus: Hubs und Autoritäten

Page 64: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Relationale HITS-Modellierung

Page 65: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Algorithmus

Page 66: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Algorithmus … in SQL

Page 67: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Map Reduce

Page 68: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Join mit Map Reduce

Page 69: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Verbesserung nach Ullman

Page 70: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Map Reduce Skripsprache: PigLatin

Page 71: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Auswertung des HITS Algorithmus

Page 72: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Peer to Peer-Informationssysteme Seti@Home

P2P number crunching

NapsterP2P file sharing / Informationsmanagement

72

Page 73: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Napster-Architektur

73

Page 74: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Gnutella-Architektur

74

Page 75: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

DHT: Distributed Hash Table Basieren auf „consistent hashing“

Vollständige Dezentralisierung der Kontrolle

Dennoch zielgerichtete Suche

75

Page 76: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

CHORD

76

Page 77: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

CAN

77

Page 78: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

No-SQL Datenbanken Internet-scale Skalierbarkeit CAP-Theorem: nur 2 von 3 Wünschen erfüllbar

Konsistenz (Consistency)Zuverläassigkeit/Verfügbarkeit (Availability)Partitionierungs-Toleranz

No-SQL Datenbanksysteme verteilen die Last innerhalb eines Clusters/NetzwerksDabei kommen oft DHT-Techniken zum Einsatz

78

Page 79: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Schnittstelle der No-SQL Datenbanken Insert(k,v) Lookup(k) Delete(k)

Extrem einfach effizient Aber: wer macht denn die Joins/Selektionen/…

das Anwendungsprogramm

79

Page 80: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Konsistenzmodell: CAP

Relaxiertes KonsistenzmodellReplizierte Daten haben nicht alle den neuesten

ZustandVermeidung des (teuren) Zwei-Phasen-Commit-Protokolls

Transaktionen könnten veraltete Daten zu lesen bekommen

Eventual ConsistencyWürde man das System anhalten, würden alle Kopien

irgendwann (also eventually) in denselben Zustand übergehen

Read your Writes-GarantieTx leist auf jeden Fall ihre eigenen Änderungen

Monotonic Read-GarantieTx würde beim wiederholten Lesen keinen älteren Zustand

als den vorher mal sichtbaren lesen 80

Page 81: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Systeme MongoDB Cassandra Dynamo BigTable Hstore SimpleDB S3

81

Page 82: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.
Page 83: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Multi-Tenancy / Cloud-Datenbanken

Page 84: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Multi-Tenancy Datenbankarchitekturen

Page 85: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Shared Tables

Page 86: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Private Relationen

Page 87: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Erweiterungs-Relationen

Page 88: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Universal Relation

Page 89: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Zerlegung: Pivot-Relationen

Page 90: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Ballung logisch verwandter Werte: Chunk Tables

Page 91: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

Key/Value-Store

Page 92: Big Data Top-k / Ranking / Skyline Semantic Web: RDF Information Retrieval PageRank / HITS Map Reduce: Massiv parallele Verarbeitung Datenströme Peer to.

XML-basiertes Schema


Recommended