LINUXSOFT.cz Přeskoč levou lištu
Uživatel: Heslo:  
   CZUKPL

> Cassandra DB - II.

Dnešní díl seriálu o NoSQL databázi Cassandra popíše její instalaci a nejdůležitější spustitelné soubory. Druhá polovina článku vysvětluje základní principy fungování Cassandry, které každý uživatel této databáze musí pochopit.

26.7.2011 00:00 | František Bártík | Články autora | přečteno 5355×

Získání softwaru a jeho instalace

Oficiální binární distribuce Cassandry je ke stažení ve formě tar.gz archivu o velikosti přibližně 10MB na oficiálních stránkách projektu. Zdrojové kódy získáte například pořízením klonu oficiálního GIT repozitáře příkazem git clone git://git.apache.org/cassandra.git. Sestavení zdrojových kódů se provádí s pomocí známého systému Apache Ant. Cassandra je uvolněna pod licencí Apache License v2.

Cassandra je napsána v Javě. Přiložený soubor README.txt informuje o minimální požadované verzi Javy. Stažená distribuce Cassandry obsahuje spustitelné soubory. Po svém spuštění bude program pracovat s adresáři /var/log/cassandra a /var/lib/cassandra, což pravděpodobně neumožní přednastavená práva. Řešením je rozšířit práva u adresářů nebo spouštět Cassandru pod superuživatelem root. Tím je instalace dokončena.

Obsah základní instalace

Samotná distribuce se skládá z adresářů conf, interface, javadoc, lib, bin a několika obvyklých souborů jako README.txt nebo LICENSE.txt. Adresář conf obsahuje konfigurační soubory, které se sami dokumentují zakomentovanými volbami a popisem. Cassandru si lze vyzkoušet na běžném PC bez nutnosti úprav továrního nastavení konfiguračních souborů. Adresář interface definuje rozhraní pro vzdálené volání databáze klienty. Právě tato vyšší rozhraní se doporučují jako základní způsob komunikace klienta s databází. (S vyjímkou CQL u nejnovější verze Cassandra ani neobsahuje žádný dotazovací jazyk.) V adresáři lib naleznete použité knihovny. Do adresáře javadoc se přikládají html soubory s automaticky vygenerovanou dokumentací.

Adresář bin obsahuje spustitelné soubory. Soubor bin/cassandra je samotná databáze. Po spuštění příkazem bin/cassandra -f databáze poslouchá podle defaultního nastavení na portu 9160. Soubor bin/cassandra-cli je administrátorská konzole pro práci s databází. Příkazy se oddělují středníky. Příkaz connect určení_pozice/určení_portu; (např. connect localhost/9160;) připojí k databázi. Možné příkazy vypíše help;. Konzole bin/cassandra-cli se soustředí na vlastní uložená data. Naopak utilita bin/nodetool se soustředí na administraci, síťování a optimalizaci serverů. Například příkaz bin/nodetool -h localhost info vypíše základní informace jako uptime, aktuální zátěž nebo spotřeba paměti o Cassandře běžící na localhostu, bin/nodetool -h localhost decommission odpojí localhosta, bin/nodetool -h localhost join připojí k localhosta... Samotný bin/nodetool bez dalších voleb vypíše všechny své přepínače.

Výpis možností nástroje nodetool

Výpis možností nástroje nodetool

Při pochopení principů fungování Cassandry a datového modelu jsou názvy příkazů v cassandra-cli a přepínačů v nodetool samovysvětlující. Zbytek dnešního dílu popisuje základní principy zasíťování Cassandry.

Základní principy fungování Cassandry

Jednotlivé instalace jsou propojeny do clusteru (ring). Mezi uzly neexistuje žádná hierarchie a každý uzel dokáže zajišťovat všechny funkce. Cassandra ani nevyžaduje nějaké konkrétní zapojení sítě. Rozdíl mezi klasickým hierarchickým clusterem typu nadřazený uzel (master) a závislé uzly (slave) a peer to peer sítí u Cassandry ilustruje následující obrázek.

vlevo P2P síť bez hierarchie, vpravo hierarchická síť master/slave

vlevo P2P síť bez hierarchie, vpravo hierarchická síť master/slave

Databáze Cassandra ukládá každý jeden záznam na pevně zadaný počet různých uzlů. Požadovaný počet replik se dá nastavit a rovněž lze vybrat z několika strategií distribuce replik v clusteru. Počet požadovaných replik v clusteru se označuje jako replikační faktor (replication factor) a logika výběru uzlů pro umístění replik se označuje jako replikační strategie (replica placement strategy, replication strategy). Při změně dat dochází k propagaci a všechny repliky jsou tak postupně aktualizovány na nejnovější hodnotu.

Rozdílné replikační strategie uložily stejná data (barevné tečky) se stejným replikačním faktorem jiným způsobem.

Rozdílné replikační strategie uložily stejná data (barevné tečky) se stejným replikačním faktorem jiným způsobem

Databáze Cassandra nepodporuje klasické transakce a podobné "složitosti", proto jsou pro pochopení základního principu fungování databáze důležité jen operace zapisování a čtení dat. Při čtení si uzel schromažďuje jednotlivé repliky. Při získávání replik může principiálně nastat pět situací.

  • Přečte se již známá verze dat.
  • Přečte se ještě neznámá verze dat. Následně se posoudí aktuálnost nově přečtené verze.
  • Na čteném uzlu ještě není uložena žádná verze repliky.
  • Přečte se informace, že příslušná data byla již smazána. Příznak smazání (tzv. tombstone) rozliší novější stav, kdy jsou data již smazána, od staršího stavu, kdy data nebyla ještě vytvořena. Smazané repliky odstraňuje korektním způsobem garbage collector.
  • Je detekován chybový stav (např. porucha některého serveru).
Po přečtení požadovaného počtu replik je na základě přečtených replik vyhodnocena nejlepší odpověď.

Nastavení požadovaného počtu přečtených replik spoluurčuje míru konzistence. Příklady možných předdefinovaných úrovní jsou ONE, QUORUM, LOCAL_QUORUM, EACH_QUORUM a ALL.

  • Při nastevení ONE se čtení dokončí hned po přečtení první repliky.
  • Při nastavení QUORUM je čtení dokončeno při přečtení nadpoloviční většiny replik.
  • Nastavení ALL vyžaduje přečtení všech replik.
  • Speciální úrovně LOCAL_QUORUM, EACH_QUORUM a DCQUORUM kladou dodatečné podmínky v situaci s více datacentry. Pochopitelně jejich použití se omezuje jen na replikační strategii definující datacentra.
Při zapisování jsou dostupné stejnojmenné úrovně, které jsou analogické úrovním při čtení. Zápis může být označen za provedený i bez zapsání repliky, proto jsou navíc dostupné i úrovně ZERO a ANY.
  • Při nastavení ZERO je zapsaní považováno za okamžitě provedené při obdržení požadavku.
  • Při nastavení ANY dokončení nastává v okamžiku, kdy je zřejmé, že replika již byla zapsána. V tomto okamžiku však mohou být vykonávány různé blokující úkony, takže vložená replika nemusí být hned dostupná pro čtení.
Uvedené úrovně konzistence při čtení a zapisování jsou pouze orientační. Dostupné úrovně a replikační strategie se u jednotlivých verzí liší nebo případně se liší jejich pojmenování. Vzhledem k modulárnímu charakteru Cassandry si lze vytvořit dokonce i vlastní.

Odolnost vůči selhání

V ideálním případě každý uzel dokáže navázat spojení s libovolným uzlem a žádný server se neporouchal. Pro kontrolu se běžící uzly se vzájemně náhodně kontaktují a tím vzájemně testují svoji dostupnost a funkčnost. V případě detekce výpadku se aktivují opravné mechanismy, které například redistribuují ztracené repliky podle znalosti zbývajících replik. Při rozumném počtu uzlů a rozumném nastavení replikační strategie je Cassandra v praxi imunní proti náhodným poruchám serverů.

Verze pro tisk

pridej.cz

 

DISKUZE

repair 28.7.2011 07:05 Radim Kolář
pocitani zaznamu 28.7.2011 17:00 Radim Kolář




Příspívat do diskuze mohou pouze registrovaní uživatelé.
> Vyhledávání software
> Vyhledávání článků

15.5.2017 23:50 /František Kučera

Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Zajímá tě DIY, CNC, SDR nebo morseovka? Přijď na sraz spolku OpenAlt, který se bude konat ve čtvrtek 18. května od 18:00 v Radegastovně Perón (Stroupežnického 20, Praha 5).


Přidat komentář

12.5.2017 16:42 /Honza Javorek
PyCon CZ, česká konference o programovacím jazyce Python, se po dvou úspěšných ročnících v Brně bude letos konat v Praze, a to 8. až 10. června. Na konferenci letos zavítá např. i Armin Ronacher, známý především jako autor frameworku Flask, šablon Jinja2/Twig, a dalších projektů. Těšit se můžete na přednášky o datové analytice, tvorbě webu, testování, tvorbě API, učení a mentorování programování, přednášky o rozvoji komunity, o použití Pythonu ve vědě nebo k ovládání nejrůznějších zařízení (MicroPython). Na vlastní prsty si můžete na workshopech vyzkoušet postavit Pythonem ovládaného robota, naučit se učit šestileté děti programovat, efektivně testovat nebo si v Pythonu pohrát s kartografickým materiálem. Kupujte lístky, dokud jsou.
Přidat komentář

2.5.2017 9:20 /Eva Rázgová
Putovní konference československé Drupal komunity "DrupalCamp Československo" se tentokrát koná 27. 5.2017 na VUT FIT v Brně. Můžete načerpat a vyměnit si zkušenosti z oblasti Drupalu 7 a 8, UX, SEO, managementu týmového vývoje, využití Dockeru pro Drupal a dalších. Vítáni jsou nováčci i experti. Akci pořádají Slovenská Drupal Asociácia a česká Asociace pro Drupal. Registrace na webu .
Přidat komentář

1.5.2017 20:31 /Pavel `Goldenfish' Kysilka
PR: 25.5.2017 proběhne v Praze konference na téma Firemní informační systémy. Hlavními tématy jsou: Informační systémy s vlastní inteligencí, efektivní práce s dokumenty, mobilní přístup k datům nebo využívání cloudu.
Přidat komentář

15.4.2017 15:20 /František Kučera
Máš rád svobodný software a hardware nebo se o nich chceš něco dozvědět? Zajímá tě IoT a radiokomunikace? Přijď na sraz spolku OpenAlt, který se bude konat ve středu 19. dubna od 18:30 v Šenkovně (Sokolská 60, Praha 2).
Přidat komentář

5.3.2017 19:12 /Redakce Linuxsoft.cz
PR: 23. března proběhne v Praze konferenci na téma Cloud computing v praxi. Hlavními tématy jsou: Nejžhavější trendy v oblasti cloudu a cloudových řešení, Moderní cloudové služby, Infrastruktura současných cloudů, Efektivní využití cloudu, Nástrahy cloudových řešení a jak se jim vyhnout.
Přidat komentář

27.2.2017 22:12 /František Kučera
Pozvánka na 137. sraz OpenAlt – Praha: Tentokrát jsme si pro vás připravili neobvyklou akci. Ve středu 1.3. v 17:30 nás přivítá sdružení CZ.NIC ve svých prostorách v Milešovské ulici číslo 5 na Praze 3, kde si pro nás připravili krátkou prezentaci jejich činnosti. Následně navštívíme jejich datacentrum pod Žižkovskou věží. Provedou nás prostory, které jsou běžnému smrtelníkovi nedostupné!
Po ukončení prohlídky se všchni odebereme do hostince U vodoucha, Jagelonská 21, Praha 3 pochutnat si na některém z vybraných piv či dát si něco na zub. Rezervaci máme od 19:30, heslo je OpenAlt.
Ale pozor! Do prostor datového centra máme omezený přístup, dostane se tam pouze 10 lidí! Takže kdo přijde dříve, ten má přednost, a občanky s sebou! Kdo nebude chtít na prohlídku datového centra, může se pomalu přesunout do hostince U vodoucha a u nepřeberné nabídky piv počkat na ostatní.
Přidat komentář

18.1.2017 0:49 /František Kučera
Členové a příznivci spolku OpenAlt se pravidelně schází v Praze a Brně. Fotky z pražských srazů za uplynulý rok si můžete prohlédnout na stránkách spolku. Příští sraz se koná už 19. ledna – tentokrát je tématem ergonomie ovládání počítače – tzn. klávesnice, myši a další zařízení. Také budete mít příležitost si prohlédnout pražský hackerspace Brmlab.
Přidat komentář

   Více ...   Přidat zprávičku

> Poslední diskuze

11.5.2017 23:32 / lelo
Re: Problém se správcem balíčků

11.5.2017 5:45 / davd mašek
Re: Problém se správcem balíčků

10.5.2017 22:54 / lelo
Re: Problém se správcem balíčků

10.5.2017 22:19 / davd mašek
Problém se správcem balíčků

17.4.2017 19:15 / Jakub shoop
chyba

Více ...

ISSN 1801-3805 | Provozovatel: Pavel Kysilka, IČ: 72868490 (2003-2017) | mail at linuxsoft dot cz | Design: www.megadesign.cz | Textová verze